{"as_of":"2026-08-14T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2469262b4b9766c990e8a6dbe62086f240e2e692d94dac4515ceef43af2bf467","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:29:18.144364Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08802/citation-record","integrity":"/paper/2608.08802/integrity","json":"/paper/2608.08802/citation-record.json","paper":"/paper/2608.08802"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-14T04:29:18.011972Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.011972Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:936fdb611a77071b800a0fb927ce98e3cef5c68219a115c59d15880c4bdae0d9","observation_id":"aaf6133e-29db-4dbb-8298-111327e5ab45","resolution":{"observed_at":"2026-08-14T04:29:18.011972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-14T04:29:18.016100Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.016100Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:f7bcd9c5c203cb73542879e421f9e2d2197fb4506a9e00ef7381458ec8c4f6ec","observation_id":"86971bd2-66ba-472d-a305-fbe0af231641","resolution":{"observed_at":"2026-08-14T04:29:18.016100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.797201Z","title":"e-SNLI:Naturallanguage inference with natural language explanations.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":"6978cbf4-d5a0-4542-ba59-2f6c74f5426d","year":2018},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.020070Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:81c592ae1b5215f8f2727127ea0e4010c10d0981ca4fc573d5bf50b6e4f52e9f","observation_id":"7b542ab2-b3a7-4ded-9438-d09b3f7b79ee","resolution":{"observed_at":"2026-08-14T04:29:18.800471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.786126Z","title":"Seibel, Yu Qiao, and Junjun He","venue":null,"work_id":"7b05c999-b3c7-44e4-a727-5c4b4e819174","year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.023601Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:f233ed06eb534c1920e9013df8c86d9f53cf0e2480609cf254caf4f80921fff9","observation_id":"4e81d58d-f92e-4832-9c99-2e0bc2a36852","resolution":{"observed_at":"2026-08-14T04:29:18.789517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.027061Z","title":"When llm meets drl: Advancing jailbreaking efficiency via drl-guided search.Advances in Neural Information Processing Systems, 37:26814–26845, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.027061Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:364a9d2aac712a3d4ed0155de272507fdc18e332bd8d326bfdcdce199b2df25e","observation_id":"2778da20-1c78-458c-84fd-1805c863c686","resolution":{"observed_at":"2026-08-14T04:29:18.027061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-14T04:29:18.031618Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.031618Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:464b49b1e7f549f725ab8e756e4f6d37d0d616cdf1702ee28965e87c55d01852","observation_id":"f2a05e50-9ecb-4dfb-bf07-1055831f30e4","resolution":{"observed_at":"2026-08-14T04:29:18.031618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.769143Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"c0f75798-5c80-4f07-b4b8-f3689449ec73","year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.037146Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:df2c9acbd11097428895fcc11a0379971939c1fb0cb2e28b83d2608c07e013ed","observation_id":"604b35ad-5a7b-40a5-9229-abda0a2f9abb","resolution":{"observed_at":"2026-08-14T04:29:18.773084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-14T04:29:18.041870Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.041870Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:1f1eb5952712984b776f3a2bea364d7eeb68539b6c877a401c3561a6887fdfb9","observation_id":"d723a6d4-3adb-441e-b604-cf36f23a40fa","resolution":{"observed_at":"2026-08-14T04:29:18.041870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-14T04:29:18.045713Z","title":"Reinforce++: Stabilizing critic-free policy opti- mization with global advantage normalization.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.045713Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:2e51b930070fd96eb661bf3cf23cd217ba6729cf538aac54710d4cfebcd744fc","observation_id":"bbbc29eb-604c-41c2-9ab1-1c06242fc7e5","resolution":{"observed_at":"2026-08-14T04:29:18.045713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20157","last_updated":"2025-05-16T22:22:27Z","snapshot_observed_at":"2026-08-11T09:50:36.697504Z","submitted_at":"2025-04-28T18:02:35Z","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20157","snapshot_observed_at":"2026-08-14T04:29:18.049711Z","title":"Toward evaluative thinking: Meta policy optimization with evolving reward models.arXiv preprint arXiv:2504.20157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.049711Z"},"links":{"cited_paper":"/paper/2504.20157","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:7ee76acbef78481d7e3f857fe201ef42aa768ad7e841a789f94435b46d002c13","observation_id":"7112acee-2383-4d63-9ac7-fbb30715048d","resolution":{"observed_at":"2026-08-14T04:29:18.049711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07044","last_updated":"2025-06-13T04:22:02Z","snapshot_observed_at":"2026-08-13T15:46:47.339256Z","submitted_at":"2025-06-08T08:47:30Z","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07044","snapshot_observed_at":"2026-08-14T04:29:18.053542Z","title":"Lingshu: A generalist foundation model for unified multimodal medical understanding and reasoning.arXiv preprint arXiv:2506.07044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.053542Z"},"links":{"cited_paper":"/paper/2506.07044","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:d435e155fe20001607d150ae911a68f6d505d9b0f631fa0ead02ceec9edd5d78","observation_id":"5c130c1b-ed88-4af7-816f-f97320837b96","resolution":{"observed_at":"2026-08-14T04:29:18.053542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.760027Z","title":"Lau, Soumya Gayen, Asma Ben Abacha, and Dina Demner-Fushman","venue":null,"work_id":"7018867b-5f24-4989-93f8-7808b6716730","year":2018},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.057998Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:d44d655e15812b0621818316b8c09eb920c291666960da064477c0ac29886130","observation_id":"43aeb306-63ab-4eed-b0e3-aad5661f587c","resolution":{"observed_at":"2026-08-14T04:29:18.763422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.061645Z","title":"Vision matters: Simple visual perturbations can boost multimodal math reasoning.arXiv preprint arXiv:2506.09736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.061645Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:bdc2f5c9c6359fddc0b0e3078840dbcae9b61496e95cb70966febf5c5faf78cc","observation_id":"91e17568-08bc-4500-aff4-f4ca428ec461","resolution":{"observed_at":"2026-08-14T04:29:18.061645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20384","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.538189Z","title":"R1-fuzz: Specializing language models for textual fuzzing via reinforcement learning.arXiv preprint arXiv:2509.20384, 2025","venue":null,"work_id":"2b92651d-a9eb-4c7f-a5fc-d406c9d0d671","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.064643Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:e4fd4931118ff82c6cc40c18b90c7f62395ab5f89aa92cfc76ab1ab13ca09ffb","observation_id":"444653c2-bcf0-45dc-b23f-6ed41ff704cb","resolution":{"observed_at":"2026-08-14T04:29:18.543826Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-14T04:29:18.068390Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.068390Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:0add0a35e847a523dda75d2d66cb2172684048e10b7a4ee811c6c9ecf0dcdb99","observation_id":"63c451a9-577b-41e9-934d-5404afefecce","resolution":{"observed_at":"2026-08-14T04:29:18.068390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.748698Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"0eea1702-149d-4866-abb9-a58eb71db9eb","year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.071481Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:814620c39ec858ae27ce8215bcb4d2768c68849436991b94dc47602c0e4bd86c","observation_id":"379df114-e619-4950-ba67-8c2d63059ddd","resolution":{"observed_at":"2026-08-14T04:29:18.752938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.074662Z","title":"R-horizon: How far can your large reasoning model really go in breadth and depth?arXiv preprint arXiv:2510.08189, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.074662Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:bbdc2cff7fa7cf3e26d396cf5d3a505267b0294df020c9f5d874c64540f21793","observation_id":"51f037b6-f459-494a-9bc9-1c14d17ef7da","resolution":{"observed_at":"2026-08-14T04:29:18.074662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.06020","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.422398Z","title":"Information-theoretic reward decomposition for generalizable rlhf.arXiv preprint arXiv:2504.06020, 2025","venue":null,"work_id":"a887897d-319d-49bc-b53d-7422369c14dc","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.078496Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:33cb0564a022462db44572d52f8a9d8c48781c798a2fcff85e9b9140e7ac148b","observation_id":"df24018e-f579-457c-b9d6-ff05b4695165","resolution":{"observed_at":"2026-08-14T04:29:18.427092Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.737637Z","title":null,"venue":null,"work_id":"2a6f6ff0-e350-4002-a571-360af9ed9c6a","year":2021},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.081528Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:37c0a5187ffab9b407ae21e537b00a254149a6962cbf53502e93ccdd1c280430","observation_id":"60f69cd1-d48e-4c15-b216-a4070237d181","resolution":{"observed_at":"2026-08-14T04:29:18.741000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-14T04:29:18.084973Z","title":"MM-Eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.084973Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:bf3625e266289886f630cd52437187eb4a3945d069a67c2837641f6243fa4919","observation_id":"af77f218-4e1a-4cf7-a9ed-cb3da1b5eeaf","resolution":{"observed_at":"2026-08-14T04:29:18.084973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00923","last_updated":"2026-07-15T15:41:30Z","snapshot_observed_at":"2026-08-06T14:26:51.797479Z","submitted_at":"2025-07-30T08:44:22Z","title":"Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00923","snapshot_observed_at":"2026-08-14T04:29:18.088848Z","title":"Beyond benchmarks: Dynamic, automatic and systematic red-teaming agents for trustworthy medical language models.arXiv preprint arXiv:2508.00923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.088848Z"},"links":{"cited_paper":"/paper/2508.00923","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:f3acaf8b84ee07c6116b627531d1048baa7372a2631d6baa01e2d47f90705ca1","observation_id":"385a074a-b56d-44ad-adb7-a9ba6a80a30a","resolution":{"observed_at":"2026-08-14T04:29:18.088848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.728584Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":"90f8e890-a277-4d9f-b66b-64c24a5bd614","year":2020},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.092652Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:dcfbde5398578e5e35ef3bdded4a8d8405fe7bfe35d298eb901ff746c8fb0bdb","observation_id":"74676aeb-72cb-4bb5-858e-5726ffc75fa6","resolution":{"observed_at":"2026-08-14T04:29:18.731708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T04:29:18.095895Z","title":"Proximal policy opti- mization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.095895Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:ee0d14302e6c8ca389fea87d54bf47c613a6ab3cd65c458a4bf817fb1e0627be","observation_id":"ab29204e-da6b-418e-a008-cd80583451de","resolution":{"observed_at":"2026-08-14T04:29:18.095895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T04:29:18.100374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.100374Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:053c28d3cf5cb424f0f6018bf832f6c4e2e60799f46fe100cce977e147ed0cc5","observation_id":"ecb6cbf9-65f5-41be-a109-5f6118658ed5","resolution":{"observed_at":"2026-08-14T04:29:18.100374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.719346Z","title":"On the value of out-of-distribution testing: An example of Goodhart’s law","venue":null,"work_id":"ab062af3-ad2b-4863-b47f-12d7ba36997b","year":2020},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.103728Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:b9e54c20c86ece6bf187164d94e78356c44be0e7e3286708bc9c69acbf8c6655","observation_id":"e29b9ae6-d993-412d-a2dc-9d42e90468b1","resolution":{"observed_at":"2026-08-14T04:29:18.722551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.710127Z","title":"Blaschko, Sien Moens, and Tomasz Stanisławek","venue":null,"work_id":"cd96de63-0ad4-41bc-be3e-04aa0bad214d","year":2023},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.107091Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:40891c1a8f043a715ce58533fdcdf1b0cd9895256d6641d9448ba6cdb2f4fd0d","observation_id":"ccb08b73-2409-4eee-b1ef-84683b71978c","resolution":{"observed_at":"2026-08-14T04:29:18.713377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.699748Z","title":"Rlhfpoison: Reward poisoningattackforreinforcementlearningwithhumanfeedbackinlargelanguagemodels","venue":null,"work_id":"44f3d407-d88c-4357-ad11-c2bb99dd45db","year":2024},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.110801Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:0d54703a2237c64c14a440d094961a5ae88c25988725178ac6d67ea8464ee0cc","observation_id":"6809d91b-f176-461c-b569-b01a3aa3d178","resolution":{"observed_at":"2026-08-14T04:29:18.702701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.113870Z","title":"Causally- enhanced reinforcement policy optimization.arXiv preprint arXiv:2509.23095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.113870Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:b3d9f048886de2e2d9471366bd8622694dd1baa00812c8da8f2cf08bc07e9533","observation_id":"0d8119a9-4d8d-4ce6-8f7f-4603a83ad0a3","resolution":{"observed_at":"2026-08-14T04:29:18.113870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24369","last_updated":"2025-05-30T09:02:07Z","snapshot_observed_at":"2026-08-09T16:12:29.442194Z","submitted_at":"2025-05-30T09:02:07Z","title":"Adversarial Preference Learning for Robust LLM Alignment","version":1},"cited_work":{"arxiv_id":"2505.24369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24369","snapshot_observed_at":"2026-08-14T04:29:18.184590Z","title":"Adversarial Preference Learning for Robust LLM Alignment","venue":"cs.LG","work_id":"a40457ba-a0ab-4278-8976-37739d3a3629","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.117327Z"},"links":{"cited_paper":"/paper/2505.24369","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:0ffc2cad4ca68b7a50afe40c2e1b9b8ef80fe189ec73abd36731668d4bc716df","observation_id":"15eeec20-fc75-485e-bf42-88045f548f37","resolution":{"observed_at":"2026-08-14T04:29:18.189926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.690821Z","title":"Dynamic multimodal evaluation with flexible complexity by vision-language bootstrapping","venue":null,"work_id":"ad60d48e-8d02-4538-8780-26555a596b32","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.124081Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:ef17a276f171d1f96f7b1211d902ebe151c756e2e6d103853dbd1392b79862a3","observation_id":"13d5d0d6-d30e-4e69-9807-018bf81c3189","resolution":{"observed_at":"2026-08-14T04:29:18.694314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.681328Z","title":"Reward-guided prompt evolving in reinforcement learning for llms","venue":null,"work_id":"9bffa92f-e8b1-47a8-a875-fd644d070e18","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.128751Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:6d469eea3bb6ad4d0ad0c6359b678c5280327bb58a167bf9b71a2ec9f3b80f54","observation_id":"8eb48e98-1365-49e8-a380-1f6bbe8008eb","resolution":{"observed_at":"2026-08-14T04:29:18.684846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.669489Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?Advances in Neural Information Processing Systems, 38:57654–57689, 2025","venue":null,"work_id":"c9e5a329-63d4-4b85-bf60-8917c8563744","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.132174Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:42a8fa9d828b67257cbc97c1c8bdd3407b5ae8d7af864e68149e23d681766b83","observation_id":"69d47463-f76f-4dd3-9a75-8e5e8d431b75","resolution":{"observed_at":"2026-08-14T04:29:18.673253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-14T04:29:18.137778Z","title":"A survey of reinforcement learning for large reasoning models.arXiv preprint arXiv:2509.08827, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.137778Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:3f522bd6f4f589a91ce8fbbef540808d790c8e3c65149bada601cd13c12eafbc","observation_id":"5a7101bf-fdf8-48a6-a434-2e89014b78d5","resolution":{"observed_at":"2026-08-14T04:29:18.137778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:29:18.659270Z","title":"Improving reward model generalization from adversarial process enhanced preferences","venue":null,"work_id":"a2869afa-917b-4257-b0f8-b8c3f59ef549","year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.141262Z"},"links":{"citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:c2a0b73fdb82021eed516eef0acdae7b176af57c251e4924f602f1c82d069349","observation_id":"d555c56a-27a3-4ad9-8b58-b8a28e521b92","resolution":{"observed_at":"2026-08-14T04:29:18.662872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-13T15:38:36.634765Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-14T04:29:18.144364Z","title":"Clean” applies none and “Both","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:18.144364Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2608.08802"},"observation_digest":"sha256:83a8e8d5aa1346e39cbfc3f704ee5f0618de0c87a968e5b7ac8dd57f3365438d","observation_id":"10a383a7-8b2a-429f-8f40-b93264a1baa2","resolution":{"observed_at":"2026-08-14T04:29:18.144364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08802","last_updated":"2026-08-09T16:36:42Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T12:44:14.066670Z","submitted_at":"2026-08-09T16:36:42Z","title":"Improving Generalization Robustness of Multimodal RLVR"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.08802."}