{"as_of":"2026-08-08T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66f88cd180ab8121ca0a3c96832ca5e11372c4cf20831d0852e111d3bc894f9f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:54.929294Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.981702Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:25a978f40b804841c045bcc117ebb5e63067b0eaff6d7eea0e1864c410e450dc","observation_id":"dd411d1f-0a5f-44d6-b5df-ac076a45f325","resolution":{"observed_at":"2026-05-15T20:56:07.750683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T15:26:54.929294Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-07T15:21:20.850969Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.929294Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:8a287bb455aa517757957c6957b96a7a105c7bf00bb57971be8c555846c2055f","observation_id":"05a4234d-b062-4944-b633-d5c847f3be3c","resolution":{"observed_at":"2026-08-07T15:26:54.929294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T15:01:36.044543Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:36.044543Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:57ff2c4e4d3aef93609d5eb425548cb3b8d310f3ac4d7c5e6b92339d3d0240e2","observation_id":"c26de6c9-a946-4bec-b57f-2df7882f7bce","resolution":{"observed_at":"2026-08-07T15:01:36.044543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T14:19:04.657935Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:04.657935Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:87beb955db6055a598cd17f3fb91b59862ba67854135db42b29c8490087ef1bd","observation_id":"2f88aef6-8697-47bb-a8ff-b2997eefa401","resolution":{"observed_at":"2026-08-07T14:19:04.657935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T14:13:52.090547Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19611","last_updated":"2025-05-26T07:27:18Z","snapshot_observed_at":"2026-08-07T14:08:12.836653Z","submitted_at":"2025-05-26T07:27:18Z","title":"Align and Surpass Human Camouflaged Perception: Visual Refocus Reinforcement Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.090547Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.19611"},"observation_digest":"sha256:205e91934cfe396c847a968c99d915faef6976ed0d1cf0cd3e25cdd110478f56","observation_id":"346c0276-220e-4c6d-b86f-e7d4bf69744d","resolution":{"observed_at":"2026-08-07T14:13:52.090547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T14:09:15.259254Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-07T14:02:26.750386Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.259254Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:dc1bba7ac61fba4d7904c04d10cfc8eaf0e3197fb0434bde8e09977bc0356d0c","observation_id":"850ec3cd-0c61-4c3f-8211-822fc8fc9f39","resolution":{"observed_at":"2026-08-07T14:09:15.259254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T12:37:50.037158Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning.arXiv preprint arXiv:2503.18013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.037158Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ec33743b2eaf08145a0b215787c7c69e3e4b940eecb0e7d8751090c9ecfb6145","observation_id":"9b77ae93-91de-49b5-8e52-1196ea0c1596","resolution":{"observed_at":"2026-08-07T12:37:50.037158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T12:22:12.120909Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-07T12:12:19.396965Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:12.120909Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:2c52c072c93e293be7dd2f1a971a1b89ff62c245531707bbb1b753f6175a1825","observation_id":"0613e258-0573-4692-ae18-f61740a8bef4","resolution":{"observed_at":"2026-08-07T12:22:12.120909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T11:35:47.736748Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning.arXiv preprint arXiv:2503.18013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.736748Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:5868f8b01ed90c7068aa622502c5c54c74f4d6504344d60687d5b74e37730f73","observation_id":"b6525d68-4675-45d3-ad5f-a6f602a39e3a","resolution":{"observed_at":"2026-08-07T11:35:47.736748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T04:57:50.569467Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-07T05:00:44.806379Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.569467Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:79716b3f0ba5ba0faecccc69eab7b73b253ab28fa1f3af748c0c05395968bfcd","observation_id":"b19bc3e2-5c75-401a-aca3-6dbb135c814f","resolution":{"observed_at":"2026-08-07T04:57:50.569467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-06T23:12:12.695884Z","title":"Vision-r1: Evolving human-free alignment in large vision- language models via vision-guided reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19469","last_updated":"2025-06-24T09:53:10Z","snapshot_observed_at":"2026-08-07T12:44:11.285996Z","submitted_at":"2025-06-24T09:53:10Z","title":"Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:12.695884Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2506.19469"},"observation_digest":"sha256:78dd9f5be0119110fc52acb242cf8a543710e2b33c096db78f498f8f5c7a8633","observation_id":"11926f27-4162-4895-8f2b-c855a4d22f50","resolution":{"observed_at":"2026-08-06T23:12:12.695884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-07-31T10:24:51.553367Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:e9455699dc5c970a546018b7c6c58fdd7a62636f37d4ad46a478b733b7f494cf","observation_id":"005b77f1-e017-4840-a79d-34eb69205190","resolution":{"observed_at":"2026-05-19T06:52:08.012516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-05T12:27:05.080004Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:05.080004Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:8f53bf7edbf7a3a7cabfd27884e70146df659cf87e5987870606fdd455796459","observation_id":"20453af6-1290-458e-a709-3063cac7be52","resolution":{"observed_at":"2026-08-05T12:27:05.080004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-04T23:11:30.555836Z","title":"Vision-R1: Evolving human-free alignment in large vision- language models via vision-guided reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06759","last_updated":"2025-09-08T14:47:57Z","snapshot_observed_at":"2026-08-08T01:24:21.409658Z","submitted_at":"2025-09-08T14:47:57Z","title":"Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:11:30.555836Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2509.06759"},"observation_digest":"sha256:ff5591e1e451d58616400d897c63883cf7ee995225a4f3c9e74a286eff892bbf","observation_id":"5eb4008c-f784-4649-a0cc-4dd41817ff9d","resolution":{"observed_at":"2026-08-04T23:11:30.555836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-04T10:40:42.936784Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning.CoRR, abs/2503.18013,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.936784Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:39a7e6bc200e16f274309bea5d4b55eb269cbf9cf90c4839c6fc6a4609f82190","observation_id":"b41ac04a-da97-4869-a536-9d821f622145","resolution":{"observed_at":"2026-08-04T10:40:42.936784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-02T12:38:41.181077Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:a5a42f0a72bf8285da9a4c8929839eddccbea4d3be765bc3a1bcdc518fbe295a","observation_id":"964003eb-ae4d-4fe1-946d-78a03b8837d5","resolution":{"observed_at":"2026-05-15T20:01:33.475041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2604.04379","last_updated":"2026-04-06T03:01:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T03:01:52Z","title":"Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T19:40:41.642852Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2604.04379"},"observation_digest":"sha256:67d7b150b3f4b4218655b80e45929f597c880b6027ff754de16501196480d5b4","observation_id":"03dde0a9-2f71-4042-b8cc-9b0a3fa53698","resolution":{"observed_at":"2026-05-10T22:35:52.494204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2604.08230","last_updated":"2026-04-09T13:21:25Z","snapshot_observed_at":"2026-07-29T20:07:11.905427Z","submitted_at":"2026-04-09T13:21:25Z","title":"Generalization Under Scrutiny: Cross-Domain Detection Progresses, Pitfalls, and Persistent Challenges","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:55.617945Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2604.08230"},"observation_digest":"sha256:423cf4908c58613166461c232b0670983372a76598199f3552f73eadd7e5371b","observation_id":"143cbac7-a3aa-4e84-b091-6391208307bc","resolution":{"observed_at":"2026-05-11T07:06:14.056710Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:96f81cf75246e6bc1b3fb08dd3a6dd99e489c191f3c547aec8879514655a1a31","observation_id":"bfeae30e-7bbb-4965-9a04-bb709ce3a7c6","resolution":{"observed_at":"2026-05-10T14:00:28.665008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2604.19218","last_updated":"2026-04-21T08:24:07Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T08:24:07Z","title":"Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:44.688117Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2604.19218"},"observation_digest":"sha256:3b7009f2e0f8f79797c0fa8c7d50e4ab6c70fad8025144e053e786d109d10f36","observation_id":"93726af1-dd57-4995-81b6-d035274dbf44","resolution":{"observed_at":"2026-05-11T13:06:04.959897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2605.01324","last_updated":"2026-05-05T09:38:12Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T08:41:53Z","title":"Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T14:30:56.297653Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2605.01324"},"observation_digest":"sha256:76502aeec34bd42589e5c5c9467bed2a3a2f07d8b53e18b0d749b16b6112b085","observation_id":"0863ece9-6c7f-4e32-94d6-292022c50a0d","resolution":{"observed_at":"2026-05-11T16:56:06.437566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2605.03485","last_updated":"2026-05-05T08:20:48Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:20:48Z","title":"MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T01:20:54.441367Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2605.03485"},"observation_digest":"sha256:e0f0b66193dcbed11a9c3818c87e7aae1890a6e93106ac986062890b9772f537","observation_id":"2cbe4ccb-6387-4101-b6b8-869a564221a4","resolution":{"observed_at":"2026-05-11T23:11:15.641687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:abb3edec94ef0bf5bd901e1bd2116fe76e16eeb8ba66e91555b5a9196e6960f4","observation_id":"84577f29-4403-40ff-9fef-de410433aa4d","resolution":{"observed_at":"2026-05-11T18:46:09.550329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:7c5d160a606f3ad6e20dbe2fbf6c094cfc26889070e4ffa781f9e338ad98b6e5","observation_id":"d19c5210-e34f-47db-85a0-ed0e69f31057","resolution":{"observed_at":"2026-07-02T12:16:57.677234Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:30f889681ddac1875c8b90da5b642397c3e5d66cb2d603ea3dddb8e0f83fc0a4","observation_id":"578c924b-c8e4-4c09-beec-4cddfe498dc2","resolution":{"observed_at":"2026-07-03T01:37:30.341513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-05T01:24:53.186762Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:58c85b17b43f6cdd53e4b204ef302260698c34757b1b8b135bfb4cc08f2120db","observation_id":"90b25e58-57d5-4e74-bbf2-7e484b9c4699","resolution":{"observed_at":"2026-07-04T10:39:45.396738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:d21ae115f10a41d1ac7c5e1bca83a01d276a7a80447aedf3bc96dba4120a2356","observation_id":"a7c47baa-2951-4fd0-b56a-17dfa008c6c9","resolution":{"observed_at":"2026-07-04T15:09:54.983303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-14T14:00:00.388339Z","title":"arXiv preprint arXiv:2503.18013 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10147","last_updated":"2026-07-11T06:15:03Z","snapshot_observed_at":"2026-08-07T02:35:47.571845Z","submitted_at":"2026-07-11T06:15:03Z","title":"REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:00.388339Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2607.10147"},"observation_digest":"sha256:7014248526320f2d29c37777c9481fb3f3006fa76379fb172bc0699619b6a57d","observation_id":"082de28b-1b62-4c6b-9689-8b7081ba8bbe","resolution":{"observed_at":"2026-07-14T14:00:00.388339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.18013/citation-record","integrity":"/paper/2503.18013/integrity","json":"/paper/2503.18013/citation-record.json","paper":"/paper/2503.18013"},"outbound":[],"paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2503.18013."}