{"as_of":"2026-08-08T08:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb7cf7845df535c87333913f3b52f1ce9c09cde301ddd42047da080867c6f107","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:04.359664Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:57:29.062496Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T15:07:04.359664Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning.arXiv preprint arXiv:2505.02835, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-07T14:59:29.508178Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.359664Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:803ef8786f7a4d5c754521d65f39db6904c53b967d223eb7d387f207ec44b35e","observation_id":"e582f9d6-11e4-4597-8b15-4d8479bce771","resolution":{"observed_at":"2026-08-07T15:07:04.359664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T14:31:22.005729Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:22.005729Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:ceba7132f931717f3d4d8940abe25c149909fab94d1fa1c62c5b6ba80b765956","observation_id":"6c8f6167-1acb-41c8-b638-8ff1fd1d1978","resolution":{"observed_at":"2026-08-07T14:31:22.005729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2505.24499","last_updated":"2026-04-09T03:43:40Z","snapshot_observed_at":"2026-08-02T11:03:18.724908Z","submitted_at":"2025-05-30T11:57:58Z","title":"Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T13:00:27.232079Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2505.24499"},"observation_digest":"sha256:3095ce763450d84c4f202ee5a82663a9a0b86bc99091c7bd8801a857ea9119af","observation_id":"aecb0807-75d4-4cd1-9858-fbf31d88585b","resolution":{"observed_at":"2026-05-19T13:02:18.180265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T11:05:19.779262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.779262Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ac434a0ec8612d77ee879a21e11731ba7ece3bb6a3bae67ca77da315fc154605","observation_id":"5c512187-0b0e-4e92-b81e-804a018e0106","resolution":{"observed_at":"2026-08-07T11:05:19.779262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T13:24:39.958836Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.958836Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6e9367c816c501660e0ba53bc5043f94fa246467a4d08a12e1fe32160b5427b2","observation_id":"c14f5cbe-4c50-4d78-8a14-f4c8a8024c93","resolution":{"observed_at":"2026-08-05T13:24:39.958836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T11:39:25.091160Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.091160Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:10a4fd66885b653b8416e6a22c8b00281b48133eb45d75a239756ea7d8eecae4","observation_id":"c7f2a4b8-a266-44fe-b9f7-48d2ba1cb883","resolution":{"observed_at":"2026-08-05T11:39:25.091160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-03T03:37:50.232604Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-03T03:37:49.338075Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.232604Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:d0cc52487d928ee8966b41ce0be374c5441e804d121ca52c98e5d33e8de44da2","observation_id":"fb148a72-3212-457f-8a67-f271635f405f","resolution":{"observed_at":"2026-08-03T03:37:50.232604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:56:33.297932Z","title":"R1-Reward: Train- ing Multimodal Reward Model Through Stable Reinforce- ment Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.297932Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a142ced7177cf1a3653592d613481515efbe941f5bd130f83e374a2b0dedf770","observation_id":"0e55930e-bd20-4101-a527-91a1f656848d","resolution":{"observed_at":"2026-08-02T19:56:33.297932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:53:08.856440Z","title":"R1-reward: Training multimodal reward model through stable rein- forcement learning.arXiv preprint arXiv:2505.02835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.856440Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:e4fd6be033077a71da317e3b7072f63bf1c34744a8ebfff59ba52f3652ac99d9","observation_id":"20f7ae9c-bff9-4157-9b2c-6b5ac5d508e4","resolution":{"observed_at":"2026-08-02T19:53:08.856440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:7f2581147832a52ab68707fd1a54b00749ecaacd4b9de56cd750d1bcd773200d","observation_id":"8e4116c8-75f2-4c32-9b37-a1a6eb7e9797","resolution":{"observed_at":"2026-05-11T05:20:59.984367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.14910","last_updated":"2026-04-27T07:40:23Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T11:52:11Z","title":"Reward-Aware Trajectory Shaping for Few-step Visual Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T11:43:55.499474Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.14910"},"observation_digest":"sha256:6e01def4ffab38da23c2b078fd25e4dcbcf81f3498b0d64e486193bd5926c2b6","observation_id":"3dc8ab51-8e38-4a81-9a20-817baa9ba334","resolution":{"observed_at":"2026-05-10T11:45:21.293870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:6ae859a937696d300b3575f4e512d058fc5c3d87977c716793d6fd2036dd8364","observation_id":"38709681-ae0f-4c6b-be99-0233d59b65eb","resolution":{"observed_at":"2026-05-11T13:26:03.799793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2604.24339","last_updated":"2026-04-27T11:31:15Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:31:15Z","title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:16.497585Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2604.24339"},"observation_digest":"sha256:ebc659e0501999849a321e2b49f110a9597f90117fc84e5546adb1131045f95f","observation_id":"876803e7-4eab-4ff8-8f2a-be4e5e29c7ac","resolution":{"observed_at":"2026-05-11T21:36:17.471032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.05922","last_updated":"2026-05-12T06:25:12Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:30:58Z","title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:37:52.346280Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.05922"},"observation_digest":"sha256:6b9d6e452f39ba6a68accdea8da22524482448917bd970605fa3c258d3ace312","observation_id":"61e56765-442a-4be9-8d1b-b0dac92a37be","resolution":{"observed_at":"2026-05-13T07:42:30.874973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.05965","last_updated":"2026-05-07T10:11:51Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:11:51Z","title":"Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:54.001327Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.05965"},"observation_digest":"sha256:cd8f51d331355aff09923807bbbdb103b88d57e1aa490c6bb08295ed4afcc1cf","observation_id":"fe7449d0-f8bb-4331-ae5c-70692f8d852c","resolution":{"observed_at":"2026-05-11T16:36:10.508835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-04T19:38:15.330922Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:4d4568a100834fbbec8ea005b4153206852b51cde279ff2355f7ad98e2925305","observation_id":"fce63959-381a-47b7-97f9-ea0711fd5167","resolution":{"observed_at":"2026-05-11T03:45:58.385559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:19b42d46930867a98c66c227237b6f9c4d45d425e32ee97b6878bebe7ca853ca","observation_id":"a04a95b7-c373-4b04-8db4-ace8ef5aa026","resolution":{"observed_at":"2026-05-12T06:01:24.224742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.09422","last_updated":"2026-05-10T08:48:58Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:48:58Z","title":"Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:57.791351Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.09422"},"observation_digest":"sha256:ceeaef35ce98ec14c1124351767f3194f75ee1c55f419a55d8cde74cfd26f7a5","observation_id":"c2321188-055e-40e6-8c19-fc000d9dd49c","resolution":{"observed_at":"2026-05-12T06:46:52.586888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.22104","last_updated":"2026-05-21T07:40:25Z","snapshot_observed_at":"2026-08-06T19:20:14.897862Z","submitted_at":"2026-05-21T07:40:25Z","title":"OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:57.063802Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.22104"},"observation_digest":"sha256:7dcfe2f71fb3f0161779b01a93d0028775b14f426d81c4c2a1266bc0f0860546","observation_id":"bc2c86d0-8265-4c27-8395-a029444a507c","resolution":{"observed_at":"2026-05-22T07:21:12.728691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2605.25437","last_updated":"2026-05-25T05:29:07Z","snapshot_observed_at":"2026-08-06T20:41:42.426074Z","submitted_at":"2026-05-25T05:29:07Z","title":"Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:55.407461Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2605.25437"},"observation_digest":"sha256:49b22104b553b746e4fb888193c4e80003a9db2374642ad75853bbffa6083153","observation_id":"4eadc967-8a10-4d7a-aed1-4aec89d466db","resolution":{"observed_at":"2026-06-29T22:54:00.573718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.02835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-02T23:57:29.062496Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning","venue":null,"work_id":"09698228-f2f6-40bf-bc90-77e4a1ad41d4","year":2025},"citing_paper":{"arxiv_id":"2606.09064","last_updated":"2026-06-08T06:02:05Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T06:02:05Z","title":"See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T17:35:07.667016Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2606.09064"},"observation_digest":"sha256:0a6d80ddc6058a71b52587321e6b14e4bb05f0efae8dc5940770c7839bc097a8","observation_id":"fb54247d-0abd-426b-9a4a-ad51fb3942ac","resolution":{"observed_at":"2026-07-02T23:57:29.063754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2505.02835 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:4703aa78b65d0a1aa324ab034b1d6b9cd7044f7f2a2252d8ee32e57e486f24eb","observation_id":"078cae58-a97a-4fe8-8ac4-a95bd8ec0d75","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-07-31T14:08:11.243120Z","title":"thinking with images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28225","last_updated":"2026-07-30T13:58:08Z","snapshot_observed_at":"2026-08-07T01:38:45.608115Z","submitted_at":"2026-07-30T13:58:08Z","title":"FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T14:08:11.243120Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2607.28225"},"observation_digest":"sha256:c7f9517d5efc87d59a6e27f4f97aced8d0bde6f1f802a58009ff0bcce7fe58cc","observation_id":"59f68406-5f9f-496c-b3a2-8f6e11c5da4b","resolution":{"observed_at":"2026-07-31T14:08:11.243120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02835/citation-record","integrity":"/paper/2505.02835/integrity","json":"/paper/2505.02835/citation-record.json","paper":"/paper/2505.02835"},"outbound":[],"paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2505.02835."}