{"as_of":"2026-08-09T04:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20b588c3f2e0a812a5b811388145247b9021271aaf13393f59225698010c474f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:39.981501Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:05:25.733973Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:59:58.567326Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-05T12:33:04.952799Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T19:29:43.382392Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:7ac8ed32c5e3158ed3514e858bde99d88d4b776e20e011f7629f30026af63d34","observation_id":"b27b417a-d61c-409b-9100-0b2d4f172ddb","resolution":{"observed_at":"2026-05-16T19:31:13.050244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-03T14:05:25.733973Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21815","last_updated":"2026-06-29T08:03:34Z","snapshot_observed_at":"2026-08-05T12:33:04.952799Z","submitted_at":"2025-12-26T01:01:25Z","title":"High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T14:05:25.733973Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2512.21815"},"observation_digest":"sha256:e14308145b8f9046197f037ce7bf5a103699afdd3d46cb60d184bc0b21ceb445","observation_id":"c68e6a67-1d50-4550-87ab-dd7ed69a86fe","resolution":{"observed_at":"2026-08-03T14:05:25.733973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2601.22297","last_updated":"2026-05-17T20:58:42Z","snapshot_observed_at":"2026-07-06T22:43:35.226546Z","submitted_at":"2026-01-29T20:21:44Z","title":"Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T14:29:15.751497Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2601.22297"},"observation_digest":"sha256:5cb4e261bc54be0761516745491d6955cfe7980c5615d5f9c5c556a580b56cf2","observation_id":"9bdd290c-5381-40d6-bcbd-09890ecf0064","resolution":{"observed_at":"2026-05-21T14:30:13.790750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.05117","last_updated":"2026-04-06T19:22:48Z","snapshot_observed_at":"2026-08-02T17:31:04.989744Z","submitted_at":"2026-04-06T19:22:48Z","title":"Watch Before You Answer: Learning from Visually Grounded Post-Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:13.305374Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.05117"},"observation_digest":"sha256:9e8fefcb9e6d841840bbc39978a30f86eae4e945c35e693c2583fb7eed705c2f","observation_id":"b1a125c1-20ee-4954-a735-d66748f1417d","resolution":{"observed_at":"2026-05-10T22:15:51.701504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:3bd01b574bc23e9c82abe81328bdfd0755d6f14e62fb6286a2e899f66ff41ec9","observation_id":"d21428b6-34ea-44c6-b988-a1c1f5f3883e","resolution":{"observed_at":"2026-05-11T13:26:03.934946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:59d72210974fa2c5ec85ed3f905b93fb1fe91bf6ef02863f8bd71a9d2f30f20e","observation_id":"9a247ef6-a82d-46aa-b669-1071141cac14","resolution":{"observed_at":"2026-05-11T13:36:08.805123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.05922","last_updated":"2026-05-12T06:25:12Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:30:58Z","title":"Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:37:52.346280Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.05922"},"observation_digest":"sha256:faaa2cd0e1ad35ed7ac6b3619757bab87f3a8ca61a4d12506536ced9f3c743c7","observation_id":"f6e06dc6-c571-49a2-9719-de29a1412d78","resolution":{"observed_at":"2026-05-13T07:42:30.768132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-04T19:38:15.330922Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:0b2a974ecd8118e8183ca9aa48a56dd801d5b58edfd4b54527bdc92aee3b8798","observation_id":"eb90c0cd-3b97-4812-80b6-710292ac054a","resolution":{"observed_at":"2026-05-11T03:45:58.496389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:1e68888ca3624b5155f538bbf4f732f929e3072b81e2ce1b2627339913281d1b","observation_id":"bc854a1f-8dce-4537-9616-c1aebfd183d1","resolution":{"observed_at":"2026-06-30T00:14:04.651999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-08-08T01:07:51.075130Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T00:03:27.948225Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:67378984fef11da14b1eb188b3195dc0ca4c37ae8ecd74e646514c857f126775","observation_id":"b631b8b4-6629-4e9c-b17c-c41a0306dd70","resolution":{"observed_at":"2026-07-04T16:59:58.569526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":"2509.00676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-07-04T16:59:58.567326Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676, 2025b","venue":null,"work_id":"6c2a84a9-640c-49ee-8a84-ff2131bcdaaa","year":2024},"citing_paper":{"arxiv_id":"2606.25034","last_updated":"2026-06-26T07:24:58Z","snapshot_observed_at":"2026-08-08T01:07:51.075130Z","submitted_at":"2026-06-23T18:00:08Z","title":"Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:16:19.502837Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2606.25034"},"observation_digest":"sha256:302ef9ce3835288422f9d8bea743add804509e55765a00b4864a1918ce8a12a3","observation_id":"15ec6608-c26e-403a-8397-d6582a6b4fc3","resolution":{"observed_at":"2026-06-29T18:03:48.808047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-02T03:20:41.208153Z","title":"arXiv preprint arXiv:2509.00676 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-07T19:04:33.731501Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.208153Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:9c123738e92cc3a31cd578d1e340988eefc1c9161586ba15545ea92b18cbedff","observation_id":"98c9f657-6b68-4eb6-8288-294bb38a9e9a","resolution":{"observed_at":"2026-08-02T03:20:41.208153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-01T17:47:42.427244Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-06T02:55:37.951193Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.427244Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:2d165bc305d3fd95a620727caec99943bafbd773a1c2063164278ed61d744676","observation_id":"c5a3c139-f196-4cae-aa08-cd8e0f2cc00a","resolution":{"observed_at":"2026-08-01T17:47:42.427244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00676/citation-record","integrity":"/paper/2509.00676/integrity","json":"/paper/2509.00676/citation-record.json","paper":"/paper/2509.00676"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:24:39.590118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.590118Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:86f3b1a6cd593c7be769dbaca4f4685e51c9db84f1b7551a57ef5ecd1848bc8d","observation_id":"2fc229f3-c54a-4901-ad3e-1b51b820e4a1","resolution":{"observed_at":"2026-08-05T13:24:39.590118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T13:24:39.596363Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.596363Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6e1999408dac235aaf3a27b9d10a05a82f481fc2eb29787b39608a66cc70606c","observation_id":"b5727700-f78a-4c26-99df-12418ed65885","resolution":{"observed_at":"2026-08-05T13:24:39.596363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T13:24:39.601972Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.601972Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:0102fd132dd720dadd76936d9b6a9099b89d95fa45fb3a14e89c83a038586433","observation_id":"5250fb7f-1788-47ef-9e57-2043d760ea48","resolution":{"observed_at":"2026-08-05T13:24:39.601972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T13:24:39.607386Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.607386Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:9c6ef3127df580d9ebf85ac8fad914bf278919a12ecbc83f737c9c80b7024d57","observation_id":"b0b34e68-9e88-4e54-865c-cba0aaa15173","resolution":{"observed_at":"2026-08-05T13:24:39.607386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T13:24:39.613659Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.613659Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:2192228f656588254904d940be02cfdf2280a4f5388949d5a35ddeeadc1093cb","observation_id":"6cb47259-c3aa-4b8a-b303-e66ff9a16ecf","resolution":{"observed_at":"2026-08-05T13:24:39.613659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.620300Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.620300Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b3c61b7ab7862dc19145d773dc088e41cd6278cbc6c30d8dfbb9460435ada3fe","observation_id":"e84394d7-224c-45a2-b0ab-6454bf1f3611","resolution":{"observed_at":"2026-08-05T13:24:39.620300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T13:24:39.626362Z","title":"Openvlthinker: An early exploration to complex vision-language reasoning via iterative self-improvement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.626362Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:cb1ee92d5bf8037ab261b0f71538caa5d36e836fd54e0acdb9b876a672e3f675","observation_id":"7fffd557-bb35-4f9b-bed8-0e1784643ed6","resolution":{"observed_at":"2026-08-05T13:24:39.626362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T13:24:39.631783Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.631783Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:269ca2c686561e48cc7002d2a706d657f35c460e9a7a267bbdaa2b4f6bab1c9d","observation_id":"b3588781-8ee6-4566-963c-9e74225587a6","resolution":{"observed_at":"2026-08-05T13:24:39.631783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.637885Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.637885Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:91c1d4c07376d80d553d831977eceb735977bc4db22749395da37bffe51ed48d","observation_id":"71821fab-acc8-4ada-a812-97ad3ddfe4df","resolution":{"observed_at":"2026-08-05T13:24:39.637885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01707","last_updated":"2024-12-25T13:32:54Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T16:15:31Z","title":"Interpretable Contrastive Monte Carlo Tree Search Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01707","snapshot_observed_at":"2026-08-05T13:24:39.642992Z","title":"Interpretable contrastive monte carlo tree search reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.642992Z"},"links":{"cited_paper":"/paper/2410.01707","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:99e4678d0c563467aaadcff5c2358baf5cf696d38e9a261d8b7bae9bfc4b4159","observation_id":"7f011b7d-e72a-4d58-9801-99b13bf437fa","resolution":{"observed_at":"2026-08-05T13:24:39.642992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T13:24:39.648950Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.648950Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:c7344668251cd71c21a6554353882e6a1808f034f6e037baad264ea39611f88d","observation_id":"d3971631-1abe-431e-9f16-cf3e1610741b","resolution":{"observed_at":"2026-08-05T13:24:39.648950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T13:24:39.653975Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.653975Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:715ed983026c49736dc3461fffd684f47ec1952cefa8ea1c783b9c712646f1ea","observation_id":"aa570e30-2544-4fe1-8f67-24262a221426","resolution":{"observed_at":"2026-08-05T13:24:39.653975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T13:24:39.659106Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.659106Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:4e522d473dd65effcc023d85ab719f628763d4abf3512d7dc7875b1277fa01ec","observation_id":"bac3de43-4733-4cfc-8917-fae8087cf7ea","resolution":{"observed_at":"2026-08-05T13:24:39.659106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T13:24:39.670700Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.670700Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d84da4205ec0998ed0fe645356f57417cc6b0f51aaeb800a032e8f1840272310","observation_id":"b349b044-87c8-4a74-8c06-fc34d9966ed2","resolution":{"observed_at":"2026-08-05T13:24:39.670700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T13:24:39.675483Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.675483Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:10a430a0645bf17ee83fc09e3c9df5f0dd5cc21ed6bb3a17180b0541ab2e5526","observation_id":"a538029e-3803-4a07-aa4f-de78abda9025","resolution":{"observed_at":"2026-08-05T13:24:39.675483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.680307Z","title":"A diagram is worth a dozen images, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.680307Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:661e922ac4b66df10b6968b033fe843bf76d1ded1d07f3bf09569b65f3018a17","observation_id":"b9ced648-191f-4b70-8392-a741a2529c46","resolution":{"observed_at":"2026-08-05T13:24:39.680307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.685138Z","title":"Process reward models that think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.685138Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:3b757d5025354cdf4bf53dd1a2ceb9820e8a9be6be1c854ecf08c37ab1c1b388","observation_id":"ef2a548f-1c98-4a1a-830e-a71a6d157ba2","resolution":{"observed_at":"2026-08-05T13:24:39.685138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T13:24:39.690648Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.690648Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:736ecedf4ae9d23b3fbab0b04540dc2eda32bdb10a2b89b9c9ed08ebc8b3fb30","observation_id":"178119a2-420c-43e2-891c-510f2a3b9fbc","resolution":{"observed_at":"2026-08-05T13:24:39.690648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-05T13:24:39.696801Z","title":"Vl-rewardbench: A challenging benchmark for vision-language generative reward models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.696801Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:445cae5031e60fe71ea487fbbc736f4710f86748701a74a3e9c71ffbe3ddbc9c","observation_id":"de18d49c-57ed-402f-a32f-3de92e04252b","resolution":{"observed_at":"2026-08-05T13:24:39.696801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T13:24:39.701994Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.701994Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:4b0a6e67b8a29afe26b38971f7609dc85e968e9536ae64f3be6d977632eaa667","observation_id":"4c40fdb1-95b6-49e4-821c-730d39f4ef74","resolution":{"observed_at":"2026-08-05T13:24:39.701994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.706968Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.706968Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e8823d6c2aca3ab227362153ab308f2c309da0b41c24bdc934296bfa20750fff","observation_id":"57fd7618-4392-4cec-957b-96f152aab42e","resolution":{"observed_at":"2026-08-05T13:24:39.706968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.711719Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.711719Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:605e86bf4b2fd62496cf42f2a60c532dc90ae5ba535ea48ba5942089d2f0be29","observation_id":"3305b9b3-48f4-453e-aaee-f65503ffafa2","resolution":{"observed_at":"2026-08-05T13:24:39.711719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.716806Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.716806Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:455ca9d740c07f1e344ebd5b91fe0b60da71ad0e752dc2d0752c7c78ba5d2393","observation_id":"3e770e54-9690-40ea-86c1-9bb263ec143a","resolution":{"observed_at":"2026-08-05T13:24:39.716806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.316514Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233","venue":null,"work_id":"2bd28eae-844d-4794-afd4-0547fee70e3f","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.722147Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e7a686f4f6352381bbd65827d84e6070888516175a10d1fac4ae7e9658d8cb65","observation_id":"07490fcf-1e7d-491e-92c7-5752b4acaefe","resolution":{"observed_at":"2026-08-05T13:24:41.322013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.298888Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"24271082-f168-446d-b2c9-22014ce05d4e","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.727020Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d474c0b70ab212e97402e43521c8d5b555509fd1c6d23dc820c965bb909b5962","observation_id":"31857890-368e-45ca-9821-07fb765e8b8a","resolution":{"observed_at":"2026-08-05T13:24:41.304994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.732122Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.732122Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:124e5e5b6ef4c1c1cd2b30eadb372aab3da07e4a96bc85026b172793c58b9567","observation_id":"723e0e19-0b3c-4c7d-80a3-904aee3178e1","resolution":{"observed_at":"2026-08-05T13:24:39.732122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-05T13:24:39.737223Z","title":"Generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.737223Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:12325d9aa301b3c76ec8a3f25aae5f969f48a1c524ad43424ef1e6117ab684b3","observation_id":"74715f75-17e2-4199-8624-cfb7477650ad","resolution":{"observed_at":"2026-08-05T13:24:39.737223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T13:24:39.742920Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.742920Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:5fab8fdc7d317c351b7506304e162243c56612ef9a34bf250bb1e356f5210b41","observation_id":"5a250e68-03df-442c-92d8-f8ca24badbbf","resolution":{"observed_at":"2026-08-05T13:24:39.742920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T13:24:39.747881Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.747881Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:928ed2b809f450e353ea7e43f8d1ad6e677e69dfc25b333dc09e7de2c1071aea","observation_id":"c55f1b8a-1eaa-499e-9d5f-ff3c7c2de962","resolution":{"observed_at":"2026-08-05T13:24:39.747881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.272169Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"f374fe9c-66a7-4961-88ee-c4ed4e346273","year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.753145Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:20321439c84278abcba4e70e5ea7ab55574d739423656bb5891a8d4a2832c698","observation_id":"34765e4b-2911-4aa3-8025-95466ac147c8","resolution":{"observed_at":"2026-08-05T13:24:41.277440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.255898Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":"7c41976d-f8dc-4f9a-b425-6ba2633db67f","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.758088Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:1710d44285bcfd8b404d50ee3b7195c2b079e738d3ddf4c9d4f616b10ff58e03","observation_id":"51c071c5-8514-4663-b398-99f275f20ad1","resolution":{"observed_at":"2026-08-05T13:24:41.260915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.763610Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.763610Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6a413829281661ca5e809781bf9b68f5f9187b0f985c482267aaa9a7ac92c3ec","observation_id":"3fcc1a58-bc25-43b9-bb6a-09da4fb64832","resolution":{"observed_at":"2026-08-05T13:24:39.763610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-05T13:24:39.768630Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.768630Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:be2c36f06e9ff5287fb47d1a92ba96a572b011097ad66e7bf2027885ac2739d1","observation_id":"946504b3-bcbd-45dc-8439-217a274ad464","resolution":{"observed_at":"2026-08-05T13:24:39.768630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08048","last_updated":"2024-10-10T15:43:55Z","snapshot_observed_at":"2026-08-04T02:20:32.851242Z","submitted_at":"2024-10-10T15:43:55Z","title":"VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08048","snapshot_observed_at":"2026-08-05T13:24:39.774604Z","title":"Verifierq: Enhancing llm test time compute with q-learning-based verifiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.774604Z"},"links":{"cited_paper":"/paper/2410.08048","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:230b13df5ebd21908acfbf44e3700d13cd055d9534cdc7f603d63975bda78e8f","observation_id":"c9be0652-2f35-4f3a-9ca3-c9eccf814e1a","resolution":{"observed_at":"2026-08-05T13:24:39.774604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.227063Z","title":"Vision language models are blind","venue":null,"work_id":"276c6378-cd70-474f-9dc1-ad9fe0811f6b","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.779624Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:766889b0f6b45e82a18e99a09cbbaca8258795188f4ab95d966df46a51e51ad9","observation_id":"7dcf6623-c1af-4cbf-9a42-11066e888fad","resolution":{"observed_at":"2026-08-05T13:24:41.232261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-07T20:47:56.781130Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T13:24:39.784349Z","title":"Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.784349Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b51edb7276ed2f59b92354b0c1daacb378a0cd5fb6bfd26f1150cb30883c395e","observation_id":"9bc0b383-70dc-41d8-b6f7-78728df2e511","resolution":{"observed_at":"2026-08-05T13:24:39.784349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T13:24:39.789396Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.789396Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:adabfdaafef854d8d903ddc19a0c3b5554aca3efa365311780d11aa5f01b105b","observation_id":"2b0c2e3f-79b5-4094-bab6-81b11772e5cc","resolution":{"observed_at":"2026-08-05T13:24:39.789396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T13:24:39.794093Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.794093Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:e02cf46e9f49cc8c2c5f6506ba4cd9c8259a4b0274208b8f2056ad84df89dbab","observation_id":"92d408ac-a580-4b8e-afc5-0296b78e67ed","resolution":{"observed_at":"2026-08-05T13:24:39.794093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T13:24:39.799101Z","title":"Aligning large multimodal models with factually augmented rlhf, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.799101Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:043732662e207b79da8de3beead213c4d0772112c730eb49e174477d9f817529","observation_id":"43047e17-8353-43d1-9bfd-bdee1207effc","resolution":{"observed_at":"2026-08-05T13:24:39.799101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T13:24:39.805838Z","title":"Mimo-vl technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.805838Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:9c50bbe5ea75d0f8ed8fce7d5a21cc2541abbf204aab9b0f3edf58931f59e825","observation_id":"1283b163-a25e-4989-99da-ea011bde4706","resolution":{"observed_at":"2026-08-05T13:24:39.805838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T13:24:39.812161Z","title":"Glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.812161Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:44a51b98f973099889a2f56ea4e96112cfadf8a3c6701aacc3663ec2861f70d0","observation_id":"879f3a98-fe4c-4a9a-8316-1e03eaad7e5a","resolution":{"observed_at":"2026-08-05T13:24:39.812161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-05T13:24:39.817974Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.817974Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d5ec72834e6e33b3b5907f97de60c3ed944e3a365e0ea25e38d14c46741a2f9b","observation_id":"fa75da25-bfe4-4e13-822e-b46c35599431","resolution":{"observed_at":"2026-08-05T13:24:39.817974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.823412Z","title":"Srpo: Enhancing multimodal llm reasoning via reflection-aware reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.823412Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a080a0aba6c81e1677cfe88f4ed302b4fcb053a68b22b7caa336127fa656f9f9","observation_id":"6164018c-232a-4b4c-9561-770c7be1db9c","resolution":{"observed_at":"2026-08-05T13:24:39.823412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T13:24:39.829566Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.829566Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:da6cd820f81410b5b00cc44851bef0d167c5308b408b06d35ff3eee2d0a93802","observation_id":"0805543d-08da-4fe1-8fcf-2341a6090190","resolution":{"observed_at":"2026-08-05T13:24:39.829566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.209500Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"7b4dd763-5031-4ab9-8c6d-8cc30ce99d92","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.835197Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:42751546aa77d75b079e0f4eb38b3031de6bbbb8b010782c75713367673305ed","observation_id":"7370178e-d63b-4e1e-a69d-d9e8cceec03c","resolution":{"observed_at":"2026-08-05T13:24:41.215347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-05T13:24:39.845687Z","title":"Visualprm: An effective process reward model for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.845687Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:bfc2f6c01e98fb3b206e44ade3028044d8f4eac36a6695f17af597fce8ae2ca5","observation_id":"5e30e8a2-f9a7-480f-ac96-142f40427ac7","resolution":{"observed_at":"2026-08-05T13:24:39.845687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-07-06T18:19:38.561528Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-05T13:24:39.852228Z","title":"Enhancing visual-language modality alignment in large vision language models via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.852228Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:d85cce2008b19aa23235f2909dbce3e18615d7c8c958be0edebf5b65976cef90","observation_id":"05e5b6d7-ed0c-4f79-b7bb-65ec5234e508","resolution":{"observed_at":"2026-08-05T13:24:39.852228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-08T15:13:22.075804Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":"2412.03704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-05T13:24:40.386203Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","venue":"cs.CV","work_id":"c1f8f2e3-f159-4193-b5f9-d1ce0694c852","year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.858355Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:5fd1f732db9680ec48d20d3d7c1b167a1e7bd03f5b8625621d297ce08d494523","observation_id":"e74bdea1-5859-4b61-a8b2-633f4646b1b9","resolution":{"observed_at":"2026-08-05T13:24:40.393917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-08T03:17:29.512287Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-05T13:24:39.864757Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.864757Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a6e80d1e3d14a4f9c908c8cea8584a8097d955ea4540b48f6545f78c7902e822","observation_id":"9baea096-df66-4209-84a4-cc84c740d227","resolution":{"observed_at":"2026-08-05T13:24:39.864757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-05T13:24:39.870088Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.870088Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:47685c492386837d7a24f106a03715c3b13b57c6a21441687c45690e0acc5306","observation_id":"47e2937b-eda5-4503-9d59-4ba53a5bd6b7","resolution":{"observed_at":"2026-08-05T13:24:39.870088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.875987Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.875987Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:4955f2a57f21ec4f0072131d5780b65515a1bf2d51bb95552cc2a70327b51464","observation_id":"3674e452-b019-4857-80a8-1c47202b94e9","resolution":{"observed_at":"2026-08-05T13:24:39.875987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.880646Z","title":"Open vision reasoner: Transferring linguistic cognitive behavior for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.880646Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b7e0014e8397c6e792566f217c7126f0ee62ab6e197020ddc57297d83acdc8e3","observation_id":"5ad221a9-477a-4640-93cf-f9ec647b244d","resolution":{"observed_at":"2026-08-05T13:24:39.880646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-07T15:14:57.062481Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T13:24:39.885634Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.885634Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:dc88b7da7bd49084fff667f24765dc2c53dc6f2b74f9c587f2b2f8ad63c72d1d","observation_id":"e3c446d9-6703-4203-825c-4baea7897aba","resolution":{"observed_at":"2026-08-05T13:24:39.885634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-05T13:24:39.892735Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.892735Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:96bcad495488da111e5e88497fa6961e93b5e357d389bb3b493b83ef72614578","observation_id":"768a6749-4d68-45da-9c1c-064e1b3fc2f9","resolution":{"observed_at":"2026-08-05T13:24:39.892735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-09T04:48:29.237275Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-05T13:24:39.898650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.898650Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:98d002c4f5edb5a46ad3d4471f6b8abd8d4ca509961062630696d4cfbf8dd1e3","observation_id":"3ed8bf8c-fce5-4454-a622-c5bef9720374","resolution":{"observed_at":"2026-08-05T13:24:39.898650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-05T13:24:39.903930Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.903930Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:580149b21b84b6ccf9800932fb14242a0f170aca0bce9fd3b469058c870c2df1","observation_id":"d55eb9da-3eb0-4479-8494-2aca89b2e0a5","resolution":{"observed_at":"2026-08-05T13:24:39.903930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.178079Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":"d2a26ef3-73d2-4b74-87f8-b383fe5e9641","year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.910004Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:380c947d6fb06b6d12328141b2e7057d2517ca301fdf76c9e34a4fba3711f07c","observation_id":"7f57d251-a640-4578-b521-e592117281b3","resolution":{"observed_at":"2026-08-05T13:24:41.183495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-05T13:24:39.914942Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.914942Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:674bf3b4d7fab17fd61bd221d1842b3d13f734c5f5154649fa79c0abc18c6b30","observation_id":"b840d0aa-88db-4ee4-8d7c-aea8368770aa","resolution":{"observed_at":"2026-08-05T13:24:39.914942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-05T13:24:39.920134Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.920134Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:43651ac38e6d1edd649801d1fb19d763b1b7e99423137eb1232a83a812bc5b4f","observation_id":"eb46d933-46d4-4af1-a71d-31fb270055d6","resolution":{"observed_at":"2026-08-05T13:24:39.920134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-06T11:35:06.948357Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22607","snapshot_observed_at":"2026-08-05T13:24:39.926180Z","title":"Vl-cogito: Progressive curriculum reinforcement learning for advanced multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.926180Z"},"links":{"cited_paper":"/paper/2507.22607","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:2d2635a3e4a8c09571cebd05f95c981f2f9b43bb2d2da7f904d3284c22e14242","observation_id":"9c80213e-e434-4764-b9a1-dd9b0fe19e70","resolution":{"observed_at":"2026-08-05T13:24:39.926180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.931710Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.931710Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:654293bbd5bd27773c88b9d4cdfb168b1e3644427fd92cbe715bbf22aa363c02","observation_id":"aea25225-aca4-4e11-a217-6a2b89ddfc92","resolution":{"observed_at":"2026-08-05T13:24:39.931710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-05T13:24:39.936440Z","title":"Internlm-xcomposer2.5-reward: A simple yet effective multi-modal reward model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.936440Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:da8e3b1d0ef1d1f16bd3cfd2110e256ea8b8cf40aeb7d21d3bc1d82349dcbea4","observation_id":"2d5e40fb-ea29-4f77-b6e6-136cf38cf54c","resolution":{"observed_at":"2026-08-05T13:24:39.936440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-05T13:24:39.942045Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.942045Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:a20efa41562c79607c0a11718bbe8af8d2693d7360b4dcb11c57bc51563b507e","observation_id":"3b2b7650-77ba-4a4c-8f8a-f9cdadc85895","resolution":{"observed_at":"2026-08-05T13:24:39.942045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-05T13:24:39.947616Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.947616Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:99ef45660101530bd41c903da7ef83c9d308fed74f09c901f50147a85a0d3e01","observation_id":"a4ba5982-1ad0-4cc9-a6b8-e41474e70ca2","resolution":{"observed_at":"2026-08-05T13:24:39.947616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T13:24:39.953253Z","title":"Nemotron-research-tool-n1: Exploring tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.953253Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:17c04822a16030ff389c0b7ba9ee78d7ae20e1976d1f0e31cce7c600a4747eea","observation_id":"8d24ae44-7827-42b1-bf90-4ea7efc56487","resolution":{"observed_at":"2026-08-05T13:24:39.953253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T13:24:39.958836Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.958836Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6e9367c816c501660e0ba53bc5043f94fa246467a4d08a12e1fe32160b5427b2","observation_id":"c14f5cbe-4c50-4d78-8a14-f4c8a8024c93","resolution":{"observed_at":"2026-08-05T13:24:39.958836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-08-05T13:24:39.964837Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.964837Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:1ad10203c6afb60ef60d3d51a36b68a558cc49576e189bf6564be4f3248fd357","observation_id":"9d7afc8e-51e1-4898-9593-28a73edb2c14","resolution":{"observed_at":"2026-08-05T13:24:39.964837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00891","last_updated":"2025-04-05T03:04:37Z","snapshot_observed_at":"2026-08-07T16:17:08.366872Z","submitted_at":"2025-04-01T15:21:05Z","title":"GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00891","snapshot_observed_at":"2026-08-05T13:24:39.969937Z","title":"Genprm: Scaling test-time compute of process reward models via generative reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.969937Z"},"links":{"cited_paper":"/paper/2504.00891","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:6b313035ec87febebf1df929d96ecbc6f793fbbb67fc6522390ea84d32974241","observation_id":"b17e8c60-dd13-46b4-9bf3-6a46a0cd282b","resolution":{"observed_at":"2026-08-05T13:24:39.969937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:41.149458Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"d0f8a90c-e490-4a05-a7a2-cec483ff4ce0","year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.975792Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:06ad56f2ca5dd49fff9608154b3cc8c7b2cb125a8e9642ca4527886181a738e3","observation_id":"30cc9626-792b-4408-b9c4-d300a389e698","resolution":{"observed_at":"2026-08-05T13:24:41.155334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:39.981501Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.981501Z"},"links":{"citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:b643cc3a052c0a6ac9f7d669947993e2c7e4df368b5a6f9611a34ec577c0cb3c","observation_id":"93c03e7c-9b72-4505-99e9-f8fe3882c242","resolution":{"observed_at":"2026-08-05T13:24:39.981501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 13 inbound Pith citation observations for arXiv:2509.00676."}