{"as_of":"2026-08-06T04:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa16105a71a5e0e2f7f80d39d832ca215c9bbe07d69253d3c32210aff7baa8f1","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:13:57.368874Z","state":"measured"},{"denominator":161,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":161,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":161,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:03:31.357707Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:17:51.904109Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:d6704c042be7953cde44bde7cbef568b38d05e76718acc7999a827a9055b4731","observation_id":"50d153ac-52ee-4466-896c-13f87e16a723","resolution":{"observed_at":"2026-05-19T06:59:03.247850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T00:26:48.291431Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2504.13958"},"observation_digest":"sha256:807c87929a31fd21348200deaa0e2f8a3a45f36baba29c1c49cd65031a82faed","observation_id":"a3daa44e-cd7e-4449-8cf8-95b9598be724","resolution":{"observed_at":"2026-05-14T00:26:48.524669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2505.15616","last_updated":"2026-05-13T12:54:20Z","snapshot_observed_at":"2026-08-03T01:38:16.643054Z","submitted_at":"2025-05-21T15:06:59Z","title":"LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T13:47:51.436258Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.15616"},"observation_digest":"sha256:984e6c7c06ed519abbeb39d7d857772f41eec15c070a526450c25ca37367e03d","observation_id":"2d815fe0-132c-418e-85ce-a5460afe14c3","resolution":{"observed_at":"2026-05-22T13:51:37.657422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:29:47.529564Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.15879"},"observation_digest":"sha256:8460141db48cdcddb3ae7bd5e1346b3d1ffb0794d9ed914b2618af1ffdde78e7","observation_id":"3dfb7bd1-d7df-41ee-85bf-a5370b257c62","resolution":{"observed_at":"2026-05-22T13:31:36.050924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:3fe11f533abad51244bef3ed9372c2372307a2b987ccac0e7cd8f971bb5ed34f","observation_id":"bb345abe-abe4-468e-a46a-62ccefe84103","resolution":{"observed_at":"2026-05-17T05:40:56.038031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:2206f09ee1502d0a2a5b95b5fe41e2b00f7b4014f3b45d422ecf9a2509f9cafc","observation_id":"d2e7c93f-81ec-4202-b55c-70010487c3c6","resolution":{"observed_at":"2026-05-22T01:05:52.018468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:a00d393ff5df35c30cbc35edd0a14e5ce746e45d4500c82782e4c193d73d8f11","observation_id":"39ad2883-297c-44a7-82b1-c22f2c117995","resolution":{"observed_at":"2026-05-19T09:12:14.430161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-07-31T10:24:51.553367Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:2e760d5e8b86c228b08424b214565cf7f807c73c3e646dc8cb0182b3fc5dd972","observation_id":"120e63a5-c52e-4a26-af2f-5fc7486869f2","resolution":{"observed_at":"2026-05-19T06:52:08.138562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-19T05:11:54.685897Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.06448"},"observation_digest":"sha256:5769f16e0b432eaf75967e7a52b9d6f5d71be676ec8f67418304623b92f9aa2c","observation_id":"b33e7b31-7f1a-48da-a873-cd18218f6cbf","resolution":{"observed_at":"2026-05-19T05:12:04.869640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T00:03:31.357707Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-06T00:03:14.607794Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:31.357707Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:d2c1b4772e1d331d9e2d4f797533d023f27a30dd529229ab6f1977db269aff73","observation_id":"e2202ed7-56a4-4e24-b511-601fe3c97091","resolution":{"observed_at":"2026-08-06T00:03:31.357707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T23:55:50.919858Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-05T23:55:45.338719Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:50.919858Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:878d7f93f0b366693210d8b635d945b72606b2ecef1c1d3745db3b0f92c76080","observation_id":"1c062ded-f0fa-4b2a-9f15-fb05a5f08c6d","resolution":{"observed_at":"2026-08-05T23:55:50.919858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T23:29:16.170654Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-05T23:29:12.759901Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.170654Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:d04ee34c9bb98e16ca06541949a905bdb404b377d950690b4db4fd0b03af0347","observation_id":"dc0e6dd3-3e5a-460d-9af1-a39a376e33f0","resolution":{"observed_at":"2026-08-05T23:29:16.170654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T23:25:49.136154Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05388","last_updated":"2025-08-07T13:38:49Z","snapshot_observed_at":"2026-08-05T23:25:39.801772Z","submitted_at":"2025-08-07T13:38:49Z","title":"An Explainable Machine Learning Framework for Railway Predictive Maintenance using Data Streams from the Metro Operator of Portugal","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:49.136154Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.05388"},"observation_digest":"sha256:fa88dea9d3fb522fa0dfeb481299a1eb3f70f2940a36b05071bf96bfeeda2eb3","observation_id":"e14cdb62-4b47-44b7-b911-927b3d75e9d3","resolution":{"observed_at":"2026-08-05T23:25:49.136154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T20:30:47.487249Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10373","last_updated":"2025-08-14T06:09:38Z","snapshot_observed_at":"2026-08-05T20:30:45.089518Z","submitted_at":"2025-08-14T06:09:38Z","title":"Privacy-Preserving Approximate Nearest Neighbor Search on High-Dimensional Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:47.487249Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.10373"},"observation_digest":"sha256:529985b23e9022c372e853950c1037ecae303f5eec729c3c68e520ef735a008c","observation_id":"d2fde7dc-d960-434c-bf0f-741f24278e8a","resolution":{"observed_at":"2026-08-05T20:30:47.487249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:3781fadf752f2ee6f5458d4522c9430004ef0723514171f5eec97fdbff11d5c1","observation_id":"e87cc55c-343f-44f9-afe5-824b64073806","resolution":{"observed_at":"2026-05-18T22:21:53.326591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T21:11:52.381315Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.14080","last_updated":"2025-08-12T19:43:44Z","snapshot_observed_at":"2026-08-05T21:11:42.256393Z","submitted_at":"2025-08-12T19:43:44Z","title":"KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:11:52.381315Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.14080"},"observation_digest":"sha256:60a1d26550449de33ec4fa605c717c50a1d99af416e67e1ccfd88fa8a74d2a0d","observation_id":"8413d793-d6fe-4cb9-9d0b-d81a2125a553","resolution":{"observed_at":"2026-08-05T21:11:52.381315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T17:04:38.739210Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-05T17:04:26.513402Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T17:04:38.739210Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.17196"},"observation_digest":"sha256:32029816c6a4128037f50dca49b7274cfc989a71acf023843a2299f96f701b2b","observation_id":"0e87eb0b-6014-49ed-9520-7068b771d9c2","resolution":{"observed_at":"2026-08-05T17:04:38.739210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T16:22:51.550260Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.550260Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:62e6028e70faf7fde92acea172d94d7406b0ca2ee792e54df496b7bc73a67ea6","observation_id":"57ac40bf-5d47-480f-9deb-01ad51d2eccb","resolution":{"observed_at":"2026-08-05T16:22:51.550260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T15:10:34.579065Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-05T15:10:32.179470Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.579065Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:d0a46d295b376b23c4ccaacd8208fe742f335f8395bd42d869ec3b827fc0d2bc","observation_id":"64f4bad2-df1b-4476-9751-a4f2260e6bc2","resolution":{"observed_at":"2026-08-05T15:10:34.579065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T15:10:16.788157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20478","last_updated":"2026-05-29T09:48:44Z","snapshot_observed_at":"2026-08-05T15:10:01.360889Z","submitted_at":"2025-08-28T06:55:08Z","title":"Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T15:10:16.788157Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.20478"},"observation_digest":"sha256:232b18c880467d08f7898728d32aaab15561547fab66bac6aa7384f20eb79a55","observation_id":"5a608ce7-6121-43d2-9c7f-03ef9b84989d","resolution":{"observed_at":"2026-08-05T15:10:16.788157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T12:27:05.031845Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:05.031845Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:b3e7577f2ed7a8762b4c39f1dfa9162f6a36e3dafdb9b5a179aff9b42afe28db","observation_id":"b2f5d191-9c2c-4fbd-98a7-87d562b885a1","resolution":{"observed_at":"2026-08-05T12:27:05.031845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T11:56:37.761608Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02164","last_updated":"2025-09-02T10:14:55Z","snapshot_observed_at":"2026-08-05T11:58:44.909820Z","submitted_at":"2025-09-02T10:14:55Z","title":"Omnidirectional Spatial Modeling from Correlated Panoramas","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:56:37.761608Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.02164"},"observation_digest":"sha256:a41593dcda796645559b69221044a3097e7c0ef99f2525c6946bab0940b0edac","observation_id":"6f7faa12-999d-4112-81b0-bde24626ac86","resolution":{"observed_at":"2026-08-05T11:56:37.761608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":226,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:0a6b10b00c4ee0622986ee62efa4ff75621dfd4d469c899eeb77b5c442abb39f","observation_id":"23566f1d-f878-43b8-a99f-e53dd0a8d5e6","resolution":{"observed_at":"2026-05-18T19:21:48.450263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T00:04:01.063328Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06174","last_updated":"2025-09-07T19:00:44Z","snapshot_observed_at":"2026-08-05T00:03:56.592916Z","submitted_at":"2025-09-07T19:00:44Z","title":"From Long to Short: LLMs Excel at Trimming Own Reasoning Chains","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:04:01.063328Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.06174"},"observation_digest":"sha256:2683faa852fd35b9193294994ab9932d2c6ef985f58ed54e3a953b424ddce8d4","observation_id":"084b67f3-fa5d-4c0f-b1bd-84c94ccd18af","resolution":{"observed_at":"2026-08-05T00:04:01.063328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T18:17:17.467108Z","title":"arXiv preprint arXiv:2504.07615","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10059","last_updated":"2025-09-12T08:46:49Z","snapshot_observed_at":"2026-08-04T22:46:35.106856Z","submitted_at":"2025-09-12T08:46:49Z","title":"Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T18:17:17.467108Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.10059"},"observation_digest":"sha256:449fc3d4c3026aa91074eccd0eded3847d827b534ef8e1301d35f17ff1d43413","observation_id":"b8ad9147-4c07-4378-9304-b9ce605681db","resolution":{"observed_at":"2026-08-04T18:17:17.467108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T16:07:39.282457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:39.282457Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c8f39bd1d5f6f162acc4a0282cf18bc39048c4e3e2becdbcd4a0173fa276b17f","observation_id":"e3735ede-680f-4e86-ba9c-427534286499","resolution":{"observed_at":"2026-08-04T16:07:39.282457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2509.21976","last_updated":"2026-04-23T16:06:02Z","snapshot_observed_at":"2026-08-05T07:42:29.124541Z","submitted_at":"2025-09-26T07:01:12Z","title":"Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T14:09:13.310620Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.21976"},"observation_digest":"sha256:a814afdd3645f0ddee768763d0272388fa4027f86091779191c1e387e9d39025","observation_id":"c3e93839-5817-4919-88f0-c24341bfb23e","resolution":{"observed_at":"2026-05-18T14:11:27.514218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:fe54c1dbc3cc7935880e612f66dd17b06633f2dd00368c55db6a65389609ae4e","observation_id":"40732e49-d2d2-40ce-8a94-1ee1e59b3e1c","resolution":{"observed_at":"2026-05-18T12:32:36.398678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2510.00072","last_updated":"2026-04-30T21:51:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T21:34:55Z","title":"Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T11:43:31.679386Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.00072"},"observation_digest":"sha256:b643556e4d11ee510bb617bf56a14c258c5bec574c0d82408b96407340052d24","observation_id":"7810c525-b166-4904-87dd-21826e7fabb3","resolution":{"observed_at":"2026-05-18T11:46:19.520512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T10:40:41.865785Z","title":"VLM-R1: A stable and generalizable r1-style large vision-language model.CoRR, abs/2504.07615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-04T23:44:29.830256Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:41.865785Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:6061e36ba2315cc9bac24425f2c4993d43ec021dd74e47d0d419a7cd4dc72369","observation_id":"50481eac-6e75-479f-bb53-dabbba35c617","resolution":{"observed_at":"2026-08-04T10:40:41.865785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T09:33:40.274255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.274255Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:4b9e0705522cc44dd7ccff58f2dfe5efbd53ab7346588ead1de9067a35874b5c","observation_id":"4b282ff1-f0d4-4fb3-982e-3019f96ae079","resolution":{"observed_at":"2026-08-04T09:33:40.274255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2510.16416","last_updated":"2026-05-17T05:54:56Z","snapshot_observed_at":"2026-08-02T06:39:30.995519Z","submitted_at":"2025-10-18T09:22:40Z","title":"SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T20:24:02.748854Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.16416"},"observation_digest":"sha256:64be00796f0df8fc9463bfdd245556f04a47031962486fb251128b6dcef06967","observation_id":"68b632cc-79aa-4d74-86a2-db543070fd90","resolution":{"observed_at":"2026-05-21T20:24:21.295605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2510.21122","last_updated":"2026-04-07T14:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-24T03:23:34Z","title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T04:39:58.296388Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.21122"},"observation_digest":"sha256:bfd77d4bcfe3067f05ead0b4c599572fbf70049682b6195e37a02722e177fafa","observation_id":"5446b5af-5cd3-4782-82a3-40fd3211f52b","resolution":{"observed_at":"2026-05-18T04:40:53.027955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T07:57:25.675221Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-08-05T09:58:17.464593Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T07:57:25.675221Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.23497"},"observation_digest":"sha256:707d9865d4b688a4a461bbfbeacbc9c974ba18f4a12d01e737d03990cb80fcd2","observation_id":"5b06dcdd-4fdf-4144-841c-ee1bdde8cf1c","resolution":{"observed_at":"2026-08-04T07:57:25.675221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T07:02:43.058582Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:43.058582Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:806ec6e9d7a27017b1825647fed136b24b734354c5b7bb81a7dc87811b1b6802","observation_id":"922c2d2e-5f95-4679-b54e-25d430a55103","resolution":{"observed_at":"2026-08-04T07:02:43.058582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2511.13026","last_updated":"2026-05-14T09:07:42Z","snapshot_observed_at":"2026-08-05T18:53:10.449994Z","submitted_at":"2025-11-17T06:25:12Z","title":"REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T22:19:36.366837Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2511.13026"},"observation_digest":"sha256:8f87a91125a183a72f76facdd11aa40e2f13e54d73cf681734c64174d81827d2","observation_id":"a2c3109a-1f58-43d4-928f-67fa88d2b826","resolution":{"observed_at":"2026-05-17T22:20:22.826442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2511.19972","last_updated":"2026-05-07T02:58:13Z","snapshot_observed_at":"2026-07-06T22:36:53.831174Z","submitted_at":"2025-11-25T06:31:57Z","title":"Boosting Reasoning in Large Multimodal Models via Activation Replay","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T05:05:48.682057Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2511.19972"},"observation_digest":"sha256:f1978247ac3bc8e2ca16e021d0b991bd1a3c573c0944021b08d1ef0f30b96332","observation_id":"fcbcb43b-483a-4ad3-b779-e84dab31f7b5","resolution":{"observed_at":"2026-05-17T05:09:04.004788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:d4e70a669b9bb10f174968954806f591d635affd7d7470faf7c0d0768e9e88ab","observation_id":"df2d44da-ba2d-454b-b5ea-d86e7af558d9","resolution":{"observed_at":"2026-05-22T12:31:32.175943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:9d6db73892b4f0bf5cc7bfdf1efb24ed24c581cbf19627f419c8a1343f5c4e87","observation_id":"d768473f-179d-44a3-8a5f-c31fc1858d95","resolution":{"observed_at":"2026-05-17T02:11:26.532514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-07-31T23:59:38.983651Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:259b31a9f3773701b97192822fd28f96cd861d1e969a89e780ac4cabc36922a4","observation_id":"6d828343-faca-4796-998e-a3172586f1a0","resolution":{"observed_at":"2026-05-17T02:18:52.253010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-03T18:15:06.983726Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-03T20:21:51.373630Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.983726Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:557eae6cd862a97ce97c0f971f28ffcfd04ad7e6cde33c2b6b00755f2acb890e","observation_id":"e1296e17-1939-44a6-8446-7d675f11bdad","resolution":{"observed_at":"2026-08-03T18:15:06.983726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:21dab0e0c3c90d697fb458e2dc5b2a47137cb7ca947f08e8b2655369c55254f7","observation_id":"9e5eac96-d3a7-4977-b03f-6de7d9092c6a","resolution":{"observed_at":"2026-05-17T00:58:46.523998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-07-30T11:23:08.233438Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:5ecc47fa62828bab1777d9fb392a0204eb14908d872bf405467f125148be325b","observation_id":"9e602e11-1181-4cc5-b439-85e1db6cec2f","resolution":{"observed_at":"2026-05-16T23:31:21.862892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-03T16:27:34.117502Z","title":"Vlm-r1: A stable and general- izable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13660","last_updated":"2026-07-03T09:12:21Z","snapshot_observed_at":"2026-08-03T16:27:22.621857Z","submitted_at":"2025-12-15T18:52:43Z","title":"Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:34.117502Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.13660"},"observation_digest":"sha256:22ad48f736cae0bfbb2314f266620c03e3899840b6bf7dbb2f294408fa9a70e6","observation_id":"a367bd6e-2075-498d-a6fc-45066e86f294","resolution":{"observed_at":"2026-08-03T16:27:34.117502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.14044","last_updated":"2026-04-30T14:06:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-16T03:19:28Z","title":"OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:00.895252Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.14044"},"observation_digest":"sha256:ae5fec7c683c4139afd759970b81574c656400cc64c363c89206eeda679fe3fd","observation_id":"f3e7f2e0-f35c-443c-b62a-4bfc073645f3","resolution":{"observed_at":"2026-05-16T22:38:37.859935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:a670a8dda2c74ff3d816884c7b0f8ec706e453e9cc99a69f55b267af6ccf381c","observation_id":"914eb0af-1b85-4fde-956b-89ab985962d8","resolution":{"observed_at":"2026-05-16T21:28:34.318011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-03T12:31:16.953290Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02918","last_updated":"2026-07-09T13:46:12Z","snapshot_observed_at":"2026-08-03T22:15:08.335889Z","submitted_at":"2026-01-06T11:00:17Z","title":"Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T12:31:16.953290Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2601.02918"},"observation_digest":"sha256:651c56abea2f68a76337b65529879de20122a668d3d59b3f713411279a444ab9","observation_id":"4d20d988-de98-49b9-85ca-d52942405647","resolution":{"observed_at":"2026-08-03T12:31:16.953290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2601.06993","last_updated":"2026-04-10T19:45:13Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T17:07:47Z","title":"Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T14:51:26.368439Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2601.06993"},"observation_digest":"sha256:80a2f32108bb679541859452969882e25296d5b2aa303783339e5314c51752f7","observation_id":"dc2e5b03-15dd-4679-80c1-38a641ff3aec","resolution":{"observed_at":"2026-05-16T14:53:00.547163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2601.23251","last_updated":"2026-05-08T11:40:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-30T18:20:23Z","title":"Structure Over Scale: Learning Visual Reasoning from Pedagogical Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:22:24.609440Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2601.23251"},"observation_digest":"sha256:f1df71c9d5fd7f30548da2299e514c68e17afe865739a3594995b20cc46ff3d3","observation_id":"c8f080b0-a003-4722-887e-ae769e568b88","resolution":{"observed_at":"2026-05-16T09:22:40.191829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:bab38936cb73ba5da0893fdb8037005584c91aac906e4c5188648a064d8c6d31","observation_id":"eed7d692-0306-4517-b330-34f47c25dd15","resolution":{"observed_at":"2026-05-16T10:02:42.482049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2602.13310","last_updated":"2026-05-07T08:00:36Z","snapshot_observed_at":"2026-08-03T02:11:51.693223Z","submitted_at":"2026-02-10T03:53:25Z","title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:53.694506Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.13310"},"observation_digest":"sha256:ec9563e90cdbfb41ff904ee168223d5705940f2bbdf836d0d17e9d4bda1380d8","observation_id":"ed327e9d-cab1-40b6-89ba-62a38fb440b9","resolution":{"observed_at":"2026-05-16T03:30:33.075965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:65b66daae33d8b67b9107d20c8999565423a300474a512d817dd4b2cc9a55651","observation_id":"9ede4606-d07b-4c39-bc6f-5ba72652507a","resolution":{"observed_at":"2026-05-15T20:50:17.290213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-02T22:10:52.040247Z","title":"arXiv preprint arXiv:2504.07615 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17665","last_updated":"2026-07-12T17:48:41Z","snapshot_observed_at":"2026-08-02T22:10:46.824382Z","submitted_at":"2026-02-19T18:59:54Z","title":"OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:10:52.040247Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.17665"},"observation_digest":"sha256:353cd87b0003928e2dc945ddc5f45595c07e607564292133e6954ab28084633b","observation_id":"ba2cd276-f181-4a38-8a66-1b6db929aa31","resolution":{"observed_at":"2026-08-02T22:10:52.040247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2602.19974","last_updated":"2026-05-07T22:11:37Z","snapshot_observed_at":"2026-07-06T22:46:45.213871Z","submitted_at":"2026-02-23T15:39:53Z","title":"RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T20:33:09.627731Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.19974"},"observation_digest":"sha256:568471eb6515f1bdaf53acee4f2e5bf60c014c1cded365e32ad0660077d1d85e","observation_id":"0c4ac23c-cb4d-45c5-a42a-e5687e6cd6d7","resolution":{"observed_at":"2026-05-15T20:36:35.289766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-02T20:19:15.914946Z","title":"arXiv preprint arXiv:2504.07615 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-04T03:41:58.938743Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:19:15.914946Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2602.23615"},"observation_digest":"sha256:a9fb8d2cc80b6bffbaa065b3668a9a323ebf57eca6293eaf95cfe7d298f8ea81","observation_id":"bab4e334-fae2-4c1e-9a71-35ae3a90e4cb","resolution":{"observed_at":"2026-08-02T20:19:15.914946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2603.13054","last_updated":"2026-05-12T23:46:22Z","snapshot_observed_at":"2026-08-01T06:50:59.992967Z","submitted_at":"2026-03-13T15:05:04Z","title":"Topo-R1: Detecting Topological Anomalies via Vision-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T11:41:27.021776Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2603.13054"},"observation_digest":"sha256:0359d2d7997acdd59a933f50d023bd7fd735f21ace2ff403718d35c505b0fc14","observation_id":"d24340bd-d641-4b58-9af2-91abae61c2c1","resolution":{"observed_at":"2026-05-15T11:45:32.863537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2504.07615 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-03T16:56:03.428939Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:90ef45774d4d721d5445435ef4403bbeecea0210d323c3eb56807824031f0469","observation_id":"d88e741c-b566-4753-a169-5bd6d602c2c9","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-13T16:55:20.099628Z","title":"Vlm-r1: A stable and general- izable r1-style large vision-language model, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27493","last_updated":"2026-06-06T05:46:49Z","snapshot_observed_at":"2026-08-05T12:08:07.856004Z","submitted_at":"2026-03-29T03:18:42Z","title":"Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T16:55:20.099628Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2603.27493"},"observation_digest":"sha256:8ae4e82499a60c69e612e97346f573dc196d608b9334eaffa9a701975fafb93a","observation_id":"87762264-c57f-424c-9ee5-131cc2f8cd53","resolution":{"observed_at":"2026-07-13T16:55:20.099628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2603.27494","last_updated":"2026-04-13T08:50:29Z","snapshot_observed_at":"2026-07-30T04:57:09.309756Z","submitted_at":"2026-03-29T03:18:57Z","title":"Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T21:35:12.859669Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2603.27494"},"observation_digest":"sha256:1beef1217a56632ff287da4e83684b6d3e1e417744f7bfffb00df5011cc189d6","observation_id":"c2ccc4dd-40fd-4eb5-93e6-34465de90ef2","resolution":{"observed_at":"2026-05-14T21:38:00.974574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.03179","last_updated":"2026-04-03T16:56:34Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T16:56:34Z","title":"Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T20:48:52.130130Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.03179"},"observation_digest":"sha256:4a7fb7ca4a93bb08804074a5acb9a27b828725ced1d21998b9670ee4057b6cc4","observation_id":"d98bb4a2-87a3-49a4-8ddc-3a8e3e69a78d","resolution":{"observed_at":"2026-05-13T20:53:16.242557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.04733","last_updated":"2026-04-24T20:17:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T15:00:54Z","title":"Discovering Failure Modes in Vision-Language Models using RL","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:21:25.761342Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.04733"},"observation_digest":"sha256:947376d1fd4aecfb53f26643b6b102343e8dacc1bdd146eee16bf4590da524ce","observation_id":"8e58e6d3-6608-4a82-912e-4955c72ecbe9","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.04780","last_updated":"2026-04-06T15:54:00Z","snapshot_observed_at":"2026-08-03T11:57:29.731869Z","submitted_at":"2026-04-06T15:54:00Z","title":"CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:32.315964Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.04780"},"observation_digest":"sha256:f0b9f958d508b3162d3b09f6dad78f24793e24e63ef5a37209869ba883fff842","observation_id":"45ff02e8-4bc7-44eb-830e-861a206ba9b6","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.08539","last_updated":"2026-04-19T05:24:16Z","snapshot_observed_at":"2026-08-03T03:38:06.402578Z","submitted_at":"2026-04-09T17:59:39Z","title":"OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:33.968186Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.08539"},"observation_digest":"sha256:e23da8d775c6d362fc4879b462714428743b570da72384df0a98851f695bda5c","observation_id":"644fa6b0-d39a-40b9-8181-83ed4e26ef8d","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:35:21.514502Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.08545"},"observation_digest":"sha256:862d6a1c9007a3fc7ef94c4087fcd71dc8ceac2cae3a9ff8ca75c92cde32e0fa","observation_id":"558253d9-6193-4e14-8cd1-4bde4fbb394c","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.09580","last_updated":"2026-02-25T16:01:07Z","snapshot_observed_at":"2026-08-02T18:54:28.820997Z","submitted_at":"2026-02-25T16:01:07Z","title":"OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T19:29:55.075825Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.09580"},"observation_digest":"sha256:063efe994dbbadf0f51101389cc90209429a28d471576d75092e94dca46fa630","observation_id":"b54b29fe-c74b-488b-846b-361f34758cb1","resolution":{"observed_at":"2026-05-15T19:30:16.474205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:0d641026eb7af9a47fa07ffb6c15c89a11d4413965ef040b4529274778e01d36","observation_id":"3b667d81-2581-4c67-9edd-12839033cef5","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.16918","last_updated":"2026-04-18T08:51:29Z","snapshot_observed_at":"2026-08-03T04:30:53.769713Z","submitted_at":"2026-04-18T08:51:29Z","title":"Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T07:27:15.270996Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.16918"},"observation_digest":"sha256:6d048da36802c7dfa86bd4e072fb5cfb45402d6035480c5c49272641ace0938c","observation_id":"c5a1fb6a-5f47-4201-af1b-736d1bcc01b9","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.18839","last_updated":"2026-04-20T21:06:12Z","snapshot_observed_at":"2026-07-06T23:05:35.374092Z","submitted_at":"2026-04-20T21:06:12Z","title":"One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-10T04:56:35.796962Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.18839"},"observation_digest":"sha256:6d72acdaed2cc2eeb05a972b1e94a3bc0620697b9f70526da4f19b4db2518acb","observation_id":"7da63503-002e-4858-ac03-28b130b5c731","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.21138","last_updated":"2026-04-22T22:58:47Z","snapshot_observed_at":"2026-07-06T23:07:47.244208Z","submitted_at":"2026-04-22T22:58:47Z","title":"Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-09T23:27:54.704794Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.21138"},"observation_digest":"sha256:19b77c37f6efcd134c4610becd629474aebe17a3dc0019a29007fa40bdc18005","observation_id":"8a67ee26-dc25-4400-9898-6c88daf9116e","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:b11e1ec894a7f5408f0803131c1348f20b19169e7d5a3f195ab478e3b9cc6a87","observation_id":"2e0ce69b-2b9b-47b9-9ed4-16a00ac1b5e8","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.22884","last_updated":"2026-04-24T08:13:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-24T08:13:19Z","title":"Can Multimodal Large Language Models Truly Understand Small Objects?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:49:53.645987Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.22884"},"observation_digest":"sha256:58899a40eae95c8d4ef4b096d46c278714a6c4eac238f09aab210e23a3ba7271","observation_id":"556148bc-c795-41eb-b6a4-212a585ea028","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.24339","last_updated":"2026-04-27T11:31:15Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:31:15Z","title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:16.497585Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.24339"},"observation_digest":"sha256:db73ebb2c00c9729376f6ef59c8d60efcfc989f2af9dcb3088a1da0da032f3d7","observation_id":"a7c99fd3-1d62-4345-bd59-091916a71229","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:70a985a08c97251d2ef8a767e6a43bf69ea1c7d0ca031ecbb0d09114cfef6332","observation_id":"d54c7844-3153-4215-be7a-09283c4ae2d5","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-09T14:36:29.666730Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:c7b3c50af7454967336bc6f362e835a43997dd92254b4e9b1e2f47b42a0f382a","observation_id":"a443c9d2-ee01-4222-879c-4cf925ed77ce","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-12T04:52:09.685243Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:ec57a166d018314626784942f12ee4eedf578baa64b489d93dce4200ff933ba3","observation_id":"460e0320-59c6-49d9-9733-236fa7616836","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.02730","last_updated":"2026-05-04T15:31:11Z","snapshot_observed_at":"2026-08-02T14:48:33.210016Z","submitted_at":"2026-05-04T15:31:11Z","title":"Perceptual Flow Network for Visually Grounded Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T18:40:55.753827Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.02730"},"observation_digest":"sha256:9ae0d6df642f08c9aef6043ffb78450a129d0d242ac794bd0adba4248cba075d","observation_id":"a81389c6-a2b6-40a6-b5d9-93a8301ae4f9","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:d0d562b1069a4b769e30d3f311c2f909f77e9f9495aa33922be5f59cc9d4832b","observation_id":"28c62c2e-3fe9-432a-b5be-a4011a0207d0","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.03403","last_updated":"2026-06-01T07:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:23:20Z","title":"GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T17:59:30.937349Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.03403"},"observation_digest":"sha256:249ed0fbf79eff334ca401c6e714dea83f200a5b2587b719210c34859715a3ba","observation_id":"658ab417-45af-4dca-a5bb-0218e6afd046","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.03403","last_updated":"2026-06-01T07:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:23:20Z","title":"GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T00:37:16.179596Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.03403"},"observation_digest":"sha256:e2a8fec504002ba4d66477dc742c0fb9af8708dcbfc1b4db4774c4f3c51ed8f2","observation_id":"67237bf4-4e75-4358-a145-afa3a8758ff2","resolution":{"observed_at":"2026-07-01T00:45:12.113174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.03485","last_updated":"2026-05-05T08:20:48Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:20:48Z","title":"MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T01:20:54.441367Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.03485"},"observation_digest":"sha256:5dd9814411551ab46d41f7e05abcf5fd8fd8461948d93df7e599175a1b4a333c","observation_id":"ad232e79-e2fc-469c-8fa9-801c3359fa6f","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.04451","last_updated":"2026-05-06T03:25:41Z","snapshot_observed_at":"2026-08-03T00:29:16.867900Z","submitted_at":"2026-05-06T03:25:41Z","title":"RemoteZero: Geospatial Reasoning with Zero Human Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T18:24:46.030608Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.04451"},"observation_digest":"sha256:b8512e3e80098810e17eb2e772cfb7a7110b2e8e5bd1f93c7d9182b1b0f0aa3a","observation_id":"da8d7f24-f5c8-4597-a479-d30a643b25c2","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.05922","last_updated":"2026-05-12T06:25:12Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:30:58Z","title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:37:52.346280Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.05922"},"observation_digest":"sha256:eca58dd8a1fbc91840162e1c2f870d93f85fa354d83de97d80e8f11de5ac9330","observation_id":"59973c7d-2181-407f-b537-ede3c94155a3","resolution":{"observed_at":"2026-05-13T07:42:30.856741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:d438a47ffc48e32452d0d3eaf67d08ec402920a9823e5a91c6b8f0dbf93e636a","observation_id":"d0cdbd11-541b-46a3-8084-81a3914bf203","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.06126","last_updated":"2026-05-07T12:31:22Z","snapshot_observed_at":"2026-08-03T10:59:40.481635Z","submitted_at":"2026-05-07T12:31:22Z","title":"AffectGPT-RL: Revealing Roles of Reinforcement Learning in Open-Vocabulary Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T07:25:42.870223Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.06126"},"observation_digest":"sha256:6446ce2800e3774d62b049b5f9e29ce48b8dcea147a0be97edddb71f55486328","observation_id":"fcf3f8e9-7323-4a66-b103-bb7f5d2fbf20","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.07505","last_updated":"2026-05-08T09:38:29Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:38:29Z","title":"LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T02:18:57.917353Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.07505"},"observation_digest":"sha256:b62ad43e8460d54c8ac7bb68d3b5e2084c10414855d48fd68a1e09a00df479dc","observation_id":"69960409-cda5-4e13-939c-a65f79365450","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:46.809307Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:a782dda9875a6e71a759b3f9cb34445b94a484452a0a0fb84f7f35f1bb27791f","observation_id":"f8acd791-5df8-4dd7-bbd6-c5a2498e6c76","resolution":{"observed_at":"2026-05-13T01:13:57.602083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-14T21:52:08.637283Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:fad27a238b1b5fe4d5d7df0df370ece47d19dd0d7614e1efcd32e18028190965","observation_id":"7c24febd-35b3-4a49-9703-83a62fa63925","resolution":{"observed_at":"2026-05-14T21:53:02.231111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:2c33fde735261e688ab5a95123c6e2c43b4977dfd2bef9d23c34a4d54f8b95e3","observation_id":"b56d0797-9ee0-43fc-8cae-06e47e8fcb9a","resolution":{"observed_at":"2026-05-13T02:57:09.524296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:0eab8f803e609a9c79049fd14fc1d0000c5e96f01c6fd0f255b3c5aa5f356b08","observation_id":"cfe4d501-f8f1-44c0-b010-d17b2a2fdd09","resolution":{"observed_at":"2026-05-14T21:29:28.677881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.12497","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-08-02T08:24:58.437346Z","submitted_at":"2026-05-12T17:59:51Z","title":"From Web to Pixels: Bringing Agentic Search into Visual Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:43.959052Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.12497"},"observation_digest":"sha256:d5bbf55a58ec1d7b6ea91e7ec1e85f93140bb6fd8417ebae63f362ed3b109d72","observation_id":"cc0f7559-f10b-461a-b8f7-da4e4af1109f","resolution":{"observed_at":"2026-05-13T05:52:22.870026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:e463a37a100b76faa63a2395870d33779e5b5bd97a745cde773124fbdc8df631","observation_id":"8612d913-230e-44a5-8cd4-73577d5900c8","resolution":{"observed_at":"2026-05-14T20:19:28.539146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.13156","last_updated":"2026-05-13T08:20:01Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:20:01Z","title":"Dual-Pathway Circuits of Object Hallucination in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:18:41.987533Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.13156"},"observation_digest":"sha256:cc1b17d1f45359176bd5eb2afc52c8fde57d303f711a275361895df94ec3c467","observation_id":"2780cb40-bb28-4db9-a1fa-814241f6ab2b","resolution":{"observed_at":"2026-05-14T19:19:23.972127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.14068","last_updated":"2026-05-15T18:52:42Z","snapshot_observed_at":"2026-08-05T10:58:54.115730Z","submitted_at":"2026-05-13T19:46:22Z","title":"CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T05:35:02.980473Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.14068"},"observation_digest":"sha256:38fa614d7777781a22734e0567f089f73f33b434c4b94ed310c50c932ab18fbf","observation_id":"aa8cacb8-9afb-4e41-bea9-bf05ffde4c41","resolution":{"observed_at":"2026-05-15T05:39:48.032650Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.14068","last_updated":"2026-05-15T18:52:42Z","snapshot_observed_at":"2026-08-05T10:58:54.115730Z","submitted_at":"2026-05-13T19:46:22Z","title":"CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T20:40:47.750678Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.14068"},"observation_digest":"sha256:0f5781d320ef8630b8d9f3250a0c8724f6cc1e7c2137dcf0e8e00ed6c361f460","observation_id":"cc8e34e9-c739-44a8-b4e4-9ec6fcefc36f","resolution":{"observed_at":"2026-05-20T20:43:43.454906Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.15864","last_updated":"2026-05-26T23:36:09Z","snapshot_observed_at":"2026-08-02T22:36:43.174236Z","submitted_at":"2026-05-15T11:31:14Z","title":"Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T19:30:21.814764Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.15864"},"observation_digest":"sha256:23785268b924b9299323c232147497ed83444ea97150ebc297273a2cd11da4cc","observation_id":"f748a5f6-7558-4d9c-a256-802773430a75","resolution":{"observed_at":"2026-05-20T19:33:42.146995Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.15864","last_updated":"2026-05-26T23:36:09Z","snapshot_observed_at":"2026-08-02T22:36:43.174236Z","submitted_at":"2026-05-15T11:31:14Z","title":"Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T19:49:05.008298Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.15864"},"observation_digest":"sha256:496adc92307aab979d3b4ee9ab447527514fafc753ac67ce7aee226ae74f1df9","observation_id":"3e34dc19-2157-4cb6-a67f-45f662c6b6cf","resolution":{"observed_at":"2026-06-30T19:55:01.633954Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.15951","last_updated":"2026-05-15T13:41:41Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:41:41Z","title":"From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T18:39:11.904941Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.15951"},"observation_digest":"sha256:4842a0f7f24bdae7d0cfb9f7267c83a6eda51e9c51a93b4faa6882542725b98a","observation_id":"0755c88d-71fc-4f4d-8870-a80a1415419a","resolution":{"observed_at":"2026-05-20T18:43:38.806515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.15997","last_updated":"2026-05-15T14:27:07Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T14:27:07Z","title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T18:20:38.720544Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.15997"},"observation_digest":"sha256:c1edfeb6a7955f7df767c9913f98dc3e64984db5d5296bb3972231f017664ef3","observation_id":"6d2089e9-74ca-4f76-801f-e0c3b3565e8e","resolution":{"observed_at":"2026-05-20T18:23:37.672397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:013930ec2bbc3aa79449c84ed868691c56485839a8fe95c7fc895a9f41ad9b95","observation_id":"390cf3a5-ba9a-4ac8-bb4e-a3208d65369c","resolution":{"observed_at":"2026-05-20T19:38:56.071277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2605.16080","last_updated":"2026-05-15T15:43:44Z","snapshot_observed_at":"2026-08-02T02:50:58.644997Z","submitted_at":"2026-05-15T15:43:44Z","title":"ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T19:31:12.594807Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2605.16080"},"observation_digest":"sha256:a57bcedf8aaa6af45b70eb50b11687611f10d0a4708f32a2ff77ab1b027b74c8","observation_id":"e0f8ecf4-68d3-45a7-baa9-88106c6b4874","resolution":{"observed_at":"2026-05-20T19:33:42.052215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.07615/citation-record","integrity":"/paper/2504.07615/integrity","json":"/paper/2504.07615/citation-record.json","paper":"/paper/2504.07615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/hiyouga/ EasyR1","venue":null,"work_id":"58f9789a-92fe-4f41-afbb-a688ec09dfa6","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:89752481db526bf2d12950b8a905485b683d96c75ddf69c163aa26a7249723db","observation_id":"23851756-2cf5-4645-ac97-4be32c9f3c81","resolution":{"observed_at":"2026-05-13T01:13:57.568179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:faa44b61ebfc2bcf98fd07677d356e38f145d0e3cf4b2f0ba9ad6110a3839992","observation_id":"d876a72b-1b40-4db6-8a81-ded882ac0cb4","resolution":{"observed_at":"2026-05-13T01:13:57.403136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6fce138739555d6138a1dd588e06262125a565ed14a341dcd8517f0b64bd01f0","observation_id":"0d80caaa-4d7e-48e9-9b76-71be48d9def9","resolution":{"observed_at":"2026-05-13T01:42:22.769824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"e1048d11-c66a-43a0-ab51-76161067e902","year":null},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:d63f886b581912404f02c8efbdc807e5cae8e1ab9a1e4395cad8956ebf82b861","observation_id":"d722ba59-8902-446f-afaf-86f2f6ff55fe","resolution":{"observed_at":"2026-05-13T01:13:57.537872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:db3308fe556381054be7b61d5c3adccdf037f7580d72cd842a96b2a78c1c7f34","observation_id":"1f561667-281c-4ced-a6f5-e96af9111c57","resolution":{"observed_at":"2026-05-13T01:13:57.515655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:372df9422add82fe4fad9326cd447aa0e4b77fdf33c9f3b2f6c452d13969d834","observation_id":"befc5d16-58e5-4381-baa3-9fde0d0f54ea","resolution":{"observed_at":"2026-05-13T01:13:57.518985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.00977","doi":"10.48550/arxiv.2406.00977","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":"arXiv (Cornell University)","work_id":"7e0c9c20-1f24-4f35-bf57-aee6d5c08598","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6672c6f420a08cb8693ac0a69891c4d2d67784c08ad0bcb19b20643880164d2b","observation_id":"54ded20d-c61f-4f0d-afe0-acdd9efd7b58","resolution":{"observed_at":"2026-05-13T01:13:57.522812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:4c544773252615a0cd360ccbe476feacf1555dc4ca06f17774474736c238127a","observation_id":"5cb3c842-f840-4ff6-a274-05f44a0ad88f","resolution":{"observed_at":"2026-05-13T17:08:13.182567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-v: Reinforcing super generalization ability in vision- language models with less than $3","venue":null,"work_id":"2946b3cb-676f-42f1-b85d-d12676a4161d","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:9bb5763af663daa9a7b0620b46575177927ce6778dcb3d7fab1a2840bac6d651","observation_id":"6ce284a4-bdfa-49c4-abff-8f1609d72718","resolution":{"observed_at":"2026-05-13T01:13:57.551540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:4e23f4e69de8d52fcf54828c739b427ee41d3cc38ce19bec8ac58e286c047d6d","observation_id":"f97b9fff-840d-4c74-a7a3-fb38cd2134f6","resolution":{"observed_at":"2026-05-13T01:13:57.530850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:57937b5ba74c2ee8066421a9fdeca0d4e58fa7f62c6494e78c028c52f19ced6e","observation_id":"b6244dcf-3734-4ed9-a83f-90d621649de1","resolution":{"observed_at":"2026-05-13T01:13:57.534553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:2a985abdd3949916f61d542e8b5b5e1e5f0731c45d99def02f99b433d7fad220","observation_id":"59d81237-41e9-41ce-ba6b-7ef537ba1516","resolution":{"observed_at":"2026-05-13T01:13:57.412568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"8f92a4cc-37f5-479a-bb3b-fde09bbe7a02","year":null},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6a83c4024e934e9091ce9222c3e27bddf03e4e142ea3dc0e98eaa721c5f0d22b","observation_id":"60aedddb-afe1-4913-b011-0ae596652a8f","resolution":{"observed_at":"2026-05-13T01:13:57.562944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-03T20:22:57.879457Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.07065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-07-04T15:09:54.970421Z","title":"arXiv preprint arXiv:2503.07065 , year=","venue":null,"work_id":"45c3a58c-d62f-4f0b-84d6-98d7c29563e4","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:8667fe90bc74e109f6a4b1e87a221f82b62191a30abea06c3e12b174c59f882b","observation_id":"87cfbd50-de8b-49ec-b945-027c72db7606","resolution":{"observed_at":"2026-05-13T01:13:57.417184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:2623c47af8ce6ebd9db4ba89cb25845e3b3aa96ef6cfad0a32a5977a59beb962","observation_id":"e2d588e2-fb9b-4a59-a291-399763e5552d","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open r1: A fully open reproduction of deepseek-r1","venue":null,"work_id":"a077d91d-ea9d-4448-9cba-0123ca55a272","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:fb5a59c683f2d4c49e57d9dee19461587beef3c7ea530d32bd6104617265de2f","observation_id":"29bc51e1-8673-4c9e-99e7-0ccb6c6ff48d","resolution":{"observed_at":"2026-05-13T01:13:57.570408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:0bb27f920447271b6e00541344c23595797c812eb4e53c6c943135972dc64034","observation_id":"d65c834a-2372-447d-9e05-dbe0880a3c18","resolution":{"observed_at":"2026-05-13T01:13:57.420952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"db42861b-f6c7-4763-b3a0-d2024a2d47ff","year":2022},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:2cc8f2552122e84533bd5bfa082fcbf3ed34e672af7212a235329fdd0afd5277","observation_id":"4986add1-f871-42ba-9788-9a1eab24a6ec","resolution":{"observed_at":"2026-05-13T01:13:57.575484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:61816313a0fa48065a0d2ba2846f10e4a78132a70c6d4d43a132ea3b0485c50f","observation_id":"ec121407-24bd-44b4-8d9c-34a06036a044","resolution":{"observed_at":"2026-05-13T01:13:57.424812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:a9eea725f8deddfba1333cfc45b88582d5c6febdbd3336ce8301de310a559e80","observation_id":"92a507b0-ac44-4c86-98cf-444840ef807a","resolution":{"observed_at":"2026-05-13T01:13:57.428243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatrex: Tam- ing multimodal llm for joint perception and understanding","venue":null,"work_id":"a3008de0-ae1d-4937-a8e1-3d9886c194a7","year":null},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:b2b8df63374575500df445755d8c14fe7bcdc801598701a4aa695270281a2f69","observation_id":"df3eeafd-ec40-49ea-90a6-77f32fe11478","resolution":{"observed_at":"2026-05-13T01:13:57.581888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding language models to images for multimodal in- puts and outputs","venue":null,"work_id":"bcde2bf9-af0b-426c-8ab1-7edb33610616","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:4b77472c0b3b45f776c5ef952499589018a1897da67c9fc1387696a69cc225bb","observation_id":"96620c89-e9fd-4328-9187-83e56a18f2ee","resolution":{"observed_at":"2026-05-13T01:13:57.584232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Buy 4 reinforce samples, get a baseline for free! 2019","venue":null,"work_id":"f3b5ce4f-8de1-4bb3-b6d2-84ab3986d2f5","year":2019},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:3091a6bcb86f776d15064c16332c8cac5cda99093454e1c587a4f246dc5687c2","observation_id":"40f9d804-f7f2-4d01-bb7e-06e0785fcac8","resolution":{"observed_at":"2026-05-13T01:13:57.586321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"6f276ad6-8f81-415d-ab86-2318774dfdcc","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:84ebffcb4983e3f2e80b5c3c890ae1f9a3c1c369ea0ce74a06b08273ac0f064f","observation_id":"d1c924ca-ac83-4baa-97d1-2ef15c5cbd5f","resolution":{"observed_at":"2026-05-13T01:13:57.588915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:036f51cca361c82b1176a6b5e8694e4383f3f87daeeb27bc1f55a65af102fd7e","observation_id":"39ab7beb-e441-48b4-b580-beb318e51e0e","resolution":{"observed_at":"2026-05-13T01:13:57.431959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"ae5b14ac-af8a-46fc-97ad-4fa0e7193f9f","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:a253785356b5831eb29ea7d078a11f5b22fc2977d993bcdd1405ef85f188a9a6","observation_id":"4af7bb55-f1f2-412e-ab54-6c910469b73d","resolution":{"observed_at":"2026-05-13T01:13:57.593975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"52573485-618a-424a-b408-b661283524e0","year":2014},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:92395df2dc04c282b8c6e22d215a6c46ecc8d61336158b1ae0f25f4722c7b25c","observation_id":"eb622797-c1b5-4bd4-9032-0072634c0e27","resolution":{"observed_at":"2026-05-13T01:13:57.596465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":"2410.18451","doi":"10.48550/arxiv.2410.18451","metadata_source":"pith","pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","venue":"cs.AI","work_id":"141992ea-4174-463c-be4a-add6252bde93","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:7afac11393338557a639aa7fa6fe143c918de5ba2d9b69934c6f606b52e1baaa","observation_id":"3ffb07b7-fc52-4abd-88c1-6c08f724bfe1","resolution":{"observed_at":"2026-05-17T16:18:01.701777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"dfd1d843-db1b-4bdb-91fa-c32dfcfafa0a","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:d2f07c96ea40932542ef44f88d4839ffba4a9f0d7f040e0ba0e69e6efc18dba1","observation_id":"e116865a-fc3d-4f9d-9c6e-00bbf0a1694c","resolution":{"observed_at":"2026-05-13T01:13:57.601079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":"ceaa7ac1-cc93-45fb-bd2d-dbe2d49fa9f2","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:f113bf24e980647a60867f379e63df8bd29ad692373eac3daa63d2b516e67b3e","observation_id":"519c1a2b-a43b-473b-96cd-1602b7642589","resolution":{"observed_at":"2026-05-13T01:13:57.540727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"ead0e903-e393-4d63-8d7a-40e0c0795e5b","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:ab82653bd708e3bfb401422a8d8cc64e1c9e0d87e864a5b90b8ab6c2a07454e1","observation_id":"a4cb96c4-7587-4556-8540-4b484a9f306f","resolution":{"observed_at":"2026-05-13T01:13:57.543304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"9d4fe8b6-a976-4811-88ab-6239af5c4a8b","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:ff4917e5172b16a3c15972526e6b2103428ff1fdd39fa19b7f4a9bd9967c6046","observation_id":"714d51d7-5cdc-4a95-99ee-c9a4ee2fc06a","resolution":{"observed_at":"2026-05-13T01:13:57.546459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09766","last_updated":"2024-06-07T09:41:36Z","snapshot_observed_at":"2026-08-04T10:35:44.012115Z","submitted_at":"2023-11-16T10:43:26Z","title":"LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores","version":4},"cited_work":{"arxiv_id":"2311.09766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.09766","snapshot_observed_at":"2026-07-07T12:53:50.204969Z","title":"Llms as narcissistic evaluators: When ego inflates evaluation scores, 2024 b","venue":"cs.CL","work_id":"78b2f05f-bf08-4c50-83e9-84526d25af2d","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2311.09766","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:cfadcebd64f7b1e2db5db2eeda5349043178ed706d256ac3fb91fd523f3fc15a","observation_id":"32ddb30e-97e4-434d-b92a-a0e9df2442ba","resolution":{"observed_at":"2026-05-13T01:13:57.439123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:83620e7bae42a155435a9ccdce4178a60e06eb8e9bbf405bf9de75622ccde1df","observation_id":"719603ed-ff0c-4359-a776-32914a220135","resolution":{"observed_at":"2026-05-13T01:13:57.442465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:acebffd1f322cace30eb90d4c808f0b7c92798e4004b9d74cf5d1d7926c63891","observation_id":"0768d0b9-8533-41be-ad6d-9c493fd87e07","resolution":{"observed_at":"2026-05-13T22:16:16.677111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:f90bc7c29dac0c1cc19aab8d92434b4a46f3552d4782606705e320c73d2e34df","observation_id":"312176dd-1196-4fa3-8c1e-fcf728b6ac8c","resolution":{"observed_at":"2026-05-13T01:13:57.451871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"90f623aa-a876-49a4-b623-8a6d31927232","year":2016},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:191bff1732598c3e5be2b03599b58e93852897588eba81e43209cffc87a9761b","observation_id":"576a9a96-81bf-465d-a663-ecf7c733f8d4","resolution":{"observed_at":"2026-05-13T01:13:57.565635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:f55f765fa77500a72b62c1d3c85473f9d0a929149023f74a8fde0865a8dbf5e3","observation_id":"ff7a526d-feeb-4460-bd3f-958d0d85ffd4","resolution":{"observed_at":"2026-05-13T01:13:57.456642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"d3b7ae22-f9a3-444d-b8cf-38d20b8f6f94","year":2022},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:b0fecf64378ca62e657bec26528c8e63d81f4833f5ebebad1a03e41f206442a0","observation_id":"92950f75-d039-474b-990a-1d00d26232f1","resolution":{"observed_at":"2026-05-13T01:13:57.577736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06627","last_updated":"2024-06-06T21:39:09Z","snapshot_observed_at":"2026-08-02T15:15:54.521833Z","submitted_at":"2024-02-09T18:59:29Z","title":"Feedback Loops With Language Models Drive In-Context Reward Hacking","version":3},"cited_work":{"arxiv_id":"2402.06627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feed- back loops with language models drive in-context reward hacking","venue":null,"work_id":"f19be27e-f4fb-4d21-8325-7c08c5fab196","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2402.06627","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:5c37c632992cc61d7116cce8a4ded7790f18ccceb0a6ee23c556802dd124598d","observation_id":"3e905d17-97ac-4822-9855-bdfcdb3f7df4","resolution":{"observed_at":"2026-05-13T01:13:57.461019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04549","last_updated":"2024-07-05T14:34:50Z","snapshot_observed_at":"2026-08-03T03:39:29.907591Z","submitted_at":"2024-07-05T14:34:50Z","title":"Spontaneous Reward Hacking in Iterative Self-Refinement","version":1},"cited_work":{"arxiv_id":"2407.04549","doi":"10.48550/arxiv.2407.04549","metadata_source":"pith","pith_arxiv_id":"2407.04549","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spontaneous reward hacking in iterative self-refinement","venue":"cs.CL","work_id":"7be47fce-249a-4aac-9729-48bcaf92cf35","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2407.04549","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:fe3bbfb90a6729d21c3ed96e263aa312f9ebe95f77b75b7e158a4459fa2fba14","observation_id":"e015528a-d976-4523-bd6f-cd551e166221","resolution":{"observed_at":"2026-05-13T01:13:57.464983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":"2503.07536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-07-04T10:39:45.355868Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","venue":"cs.CL","work_id":"30c18d3e-432d-404b-9572-1c7375bee8ed","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:56b7e2bc78cf762efb60140bcb98226552d5122e9c3f0b8b2ac32fcbba6a215e","observation_id":"0a5012b6-ab47-4ea5-ba0e-2123d4e15ffd","resolution":{"observed_at":"2026-05-16T15:15:46.589538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"78c18290-c1a2-4436-8636-a19104820f03","year":2021},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:0d91427d3e35acfa3d8dc888cd5cd3488772876d1d98cf339a8b1a13c3a0076d","observation_id":"4260cbdf-4111-46a3-924b-0795a670a64f","resolution":{"observed_at":"2026-05-13T01:13:57.549047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-05T08:31:40.101811Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":"2405.10300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-07-04T13:29:51.401689Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":"6a6347d8-e869-489f-9e0e-19ffb2023438","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:9c0e9de4baab4b2458619ab2b86d992c1e70ad625babc59ac8fbccdf45c11d31","observation_id":"6a4c6fa0-345c-4a6c-8450-e3c305b51d1a","resolution":{"observed_at":"2026-05-13T01:13:57.473789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:15c6c16a803f865c79c469c1e6305287273477418a209ce52125b588c68a2fd6","observation_id":"c7dd6100-c3bf-4b53-820a-23ed941ebf2a","resolution":{"observed_at":"2026-05-13T01:13:57.477597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:1c0cb575d27d344bc4bd8bc5a9db4bb8527dea117e485119b5cbd2309143f916","observation_id":"0bcfd00e-02d1-49a0-b713-31c1c48b6d53","resolution":{"observed_at":"2026-05-13T01:13:57.481688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6593d412dbe0baaeaff1f77552517a4f1aa60440766c9272ec1343507e3eb708","observation_id":"0a0c0629-f13f-49fd-8b7a-bdcf99bef568","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"c52f7a2d-9fa3-42e1-b12b-c5bed6ab5296","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:82daf97ffd2980c420f294a5c8838829b87926225cfa97052dd2884bd80a3046","observation_id":"97464a48-6f5b-4f1d-865f-85cc5f5f6761","resolution":{"observed_at":"2026-05-13T01:13:57.579846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-03T19:35:11.838629Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":"2305.17926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-07-11T02:27:48.661096Z","title":"Large Language Models are not Fair Evaluators","venue":"cs.CL","work_id":"d04a3326-b025-498f-a8f0-3d2df254a77f","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:44c260403e79abf8b0d824e40589191723f08b191153abc9546055e49460d432","observation_id":"4dc7ce2f-2b29-4453-a42b-bdc1b9ca76e6","resolution":{"observed_at":"2026-05-17T12:10:42.624770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:f9c4aa706c8b7163925a01bc4fc486a1ef6f151638e6e969b18ea2c5beb12d9a","observation_id":"8852da8b-6d3d-4006-b01d-eab1f18e271e","resolution":{"observed_at":"2026-05-13T01:13:57.493907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-07-06T19:18:12.969683Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":"2409.12822","doi":"10.48550/arxiv.2409.12822","metadata_source":"pith","pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language models learn to mislead humans via rlhf","venue":"cs.CL","work_id":"4e7ac831-1344-4b1d-910b-7698f7d1c019","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:f08992350054de32bc27f17ac49e8de9c242c28ca05208f983369667436e0ff4","observation_id":"ac9d3ad7-dcab-4178-9e0e-76e51601f9aa","resolution":{"observed_at":"2026-05-13T01:13:57.497300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Described object detection: Liberating ob- ject detection with flexible expressions","venue":null,"work_id":"184d8b9b-1eea-4294-bd06-d0d4bef04454","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:aef6ef1cf8fbb70b4de3f0f0b9090e797ccfd78907bf93160a3479a9f5c7d16a","observation_id":"0bb6fb3e-5c44-4609-9991-6cae86b810ba","resolution":{"observed_at":"2026-05-13T01:13:57.556933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":"2503.10615","doi":"10.48550/arxiv.2503.10615","metadata_source":"pith","pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","venue":"cs.CV","work_id":"bd2bf4d0-20bf-49b8-8dac-b54a8019be6c","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:cd1372eaaeb5bbd2f70bf0f175b8d06afec3c4d628935a2477d8f1e39231b178","observation_id":"32c79bb6-a543-416a-a4de-de98b4996187","resolution":{"observed_at":"2026-05-16T00:19:20.780377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13177","last_updated":"2023-12-18T07:29:55Z","snapshot_observed_at":"2026-08-01T19:22:07.600105Z","submitted_at":"2023-08-25T04:54:32Z","title":"How to Evaluate the Generalization of Detection? A Benchmark for Comprehensive Open-Vocabulary Detection","version":2},"cited_work":{"arxiv_id":"2308.13177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13177","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How to evaluate the generalization of detection? a benchmark for comprehensive open-vocabulary detection","venue":null,"work_id":"4359f02a-7fae-41b9-a417-541523bfefa6","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2308.13177","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:3cc8b4ebfba1352218cd520e8759e075e06f8554a3c6f70c4be1555ff83399ba","observation_id":"b0d54564-a0a2-4f3b-a323-1f5002bf9c74","resolution":{"observed_at":"2026-05-13T01:13:57.504666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"2ff52ba4-92f8-4642-8841-496bb57c5fca","year":2016},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:8e41b6cac27ad4927afef49c324c4f743b9a8faf120ab22b1288e9b7346c4b64","observation_id":"c12a8a19-e14d-4903-b53d-cd91c3f4f356","resolution":{"observed_at":"2026-05-13T01:13:57.591143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":"2501.12368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-07-02T22:27:25.514916Z","title":"Internlm-xcomposer2","venue":null,"work_id":"499855fc-7d44-43d3-ab3a-1038d2ccd0bc","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:3334b1f2cb3a0648d96dfa93b63f6bf673cf5c391fa9364b192fe01e5077793f","observation_id":"4a697026-1be9-46ed-b0f5-473b729784fc","resolution":{"observed_at":"2026-05-13T01:13:57.508448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"db576ba5-8341-435b-92e3-278fea236af1","year":null},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:e524455e5e56c7341f28735de4043604f960fdef192b14e2d367ebc0b5498266","observation_id":"983bf605-c8de-4172-855f-4c222e59ceda","resolution":{"observed_at":"2026-05-13T01:13:57.554184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":"e2707689-8d75-467c-94aa-05f32c2329ac","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:0bdf1479fe6cfaa47f67bb87d71a20ea8c7544d4b8c1124488c1b556e0f86cfd","observation_id":"4cf301d3-284d-4ff2-826c-b2041dda12f0","resolution":{"observed_at":"2026-05-13T01:13:57.559930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omdet: Language-aware object detection with large-scale vision-language multi-dataset pre-training","venue":null,"work_id":"ee66b481-4064-4e6d-a146-52483fa89769","year":2022},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:0e6758fa38cc40291f1c154af364e66b8b756b62c80249b3c11b290dc386e89b","observation_id":"bd5c7bf4-fd3b-4804-9941-6e554ecaee2b","resolution":{"observed_at":"2026-05-13T01:13:57.572920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omdet: Large-scale vision-language multi-dataset pre-training with multimodal detection network","venue":null,"work_id":"9872213d-52bf-421a-a363-41839c27f797","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:584e070d53314d7939d54111f44e7ee65d01f9d1c7da33caff19ff46c6925951","observation_id":"f10f13e6-8ffa-40a6-87cc-4a8590c18a86","resolution":{"observed_at":"2026-05-13T01:13:57.598711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":"2503.05132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-07-03T20:48:56.122150Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","venue":"cs.AI","work_id":"6f1085b5-ac9c-45c9-8277-b11a779f1cba","year":2025},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6d39c4ebc682c021f70c39186a94b1c07ccfdc57e8afea57a541f483346818b2","observation_id":"75430d7b-4914-4aba-98af-b33c3d837f81","resolution":{"observed_at":"2026-05-19T07:13:47.672124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 100 inbound Pith citation observations for arXiv:2504.07615."}