{"as_of":"2026-08-23T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa60b5252601af2ea08bcde7e25b41e4f736b04d154f35666ab3cdc57013dfd9","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:29:17.102230Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.05383/citation-record","integrity":"/paper/2508.05383/integrity","json":"/paper/2508.05383/citation-record.json","paper":"/paper/2508.05383"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-20T20:37:36.775968Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T23:29:13.766583Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:13.766583Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:e5a104a5f2961ae34a9414906842b8ad6cdd95ea175f8f6bcca24738eb238636","observation_id":"80ad6a69-6d28-470a-a1e7-4609fbb6fd38","resolution":{"observed_at":"2026-08-05T23:29:13.766583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:13.808513Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:13.808513Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:849b15ea1d5620d7cdba9b87e822dcd5914208f53b7204194783ae977c725a36","observation_id":"66f41efe-fd1e-40ee-b23d-52eda21325e7","resolution":{"observed_at":"2026-08-05T23:29:13.808513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:13.911172Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:13.911172Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:d75ca7a6e0cf526a11bf9e2d7ab4bb12e04130e153d3089c1828c0acd52e854e","observation_id":"f7a78e0a-2303-4ced-8e0a-f587fe6416ab","resolution":{"observed_at":"2026-08-05T23:29:13.911172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T23:29:14.091099Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.091099Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:6930eb2943b867d7f2cb6ceb3b172b030ce53fbf8f166eefea02b8b2fb970940","observation_id":"e7ee3099-9567-4146-a212-0661e622810a","resolution":{"observed_at":"2026-08-05T23:29:14.091099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:14.256851Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.256851Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:82bdea32906424797b06a5f7597e94eb0d079404e865026c2a999f4af0127779","observation_id":"773c28a8-45e9-49ff-ab11-7031579c1417","resolution":{"observed_at":"2026-08-05T23:29:14.256851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21177","last_updated":"2025-06-09T07:01:54Z","snapshot_observed_at":"2026-08-21T03:38:46.435478Z","submitted_at":"2025-05-27T13:29:08Z","title":"SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21177","snapshot_observed_at":"2026-08-05T23:29:14.367560Z","title":"Solidgeo: Measuring multimodal spatial math reasoning in solid geometry.arXiv preprint arXiv:2505.21177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.367560Z"},"links":{"cited_paper":"/paper/2505.21177","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:8def35a60654a34ad4b976163add49a70527c08220d5b3af96c7591bf3ec959d","observation_id":"fd97cdbd-84ef-44a5-8e05-c975d9995c0a","resolution":{"observed_at":"2026-08-05T23:29:14.367560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T23:29:14.487310Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.487310Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:a9ee3eb5dc1141e95132734cc9b8e8655a1369550985cafd55f5a6055f83d992","observation_id":"17d1e031-80e0-44bd-a927-b968a3401fa6","resolution":{"observed_at":"2026-08-05T23:29:14.487310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14702","last_updated":"2026-05-10T19:30:43Z","snapshot_observed_at":"2026-08-19T19:02:34.472298Z","submitted_at":"2024-10-06T20:35:41Z","title":"Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14702","snapshot_observed_at":"2026-08-05T23:29:14.682753Z","title":"Polymath: A challenging multi-modal mathematical reasoning benchmark.arXiv preprint arXiv:2410.14702, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.682753Z"},"links":{"cited_paper":"/paper/2410.14702","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:d4971ec4f20ecbfadc6b77dbc931e98c24bae830eb5de445edbdbe3a82f2eeda","observation_id":"cf2837e5-30b2-4a4f-84b8-8c7912e0264c","resolution":{"observed_at":"2026-08-05T23:29:14.682753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:14.868582Z","title":"Mathscape: Evaluating mllms in multimodal math scenarios through a hierarchical benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:14.868582Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:eae90eef00b199fba147076870eb7aad89803c86b0ea9c84eab185e74bbe84fc","observation_id":"65d639d0-9eae-4eb5-a164-98cfa1390041","resolution":{"observed_at":"2026-08-05T23:29:14.868582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05474","last_updated":"2024-10-07T20:12:08Z","snapshot_observed_at":"2026-08-16T13:11:45.865913Z","submitted_at":"2024-10-07T20:12:08Z","title":"R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05474","snapshot_observed_at":"2026-08-05T23:29:15.024275Z","title":"R-bench: Are your large multimodal model robust to real-world corruptions?arXiv preprint arXiv:2410.05474, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.024275Z"},"links":{"cited_paper":"/paper/2410.05474","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:18667186ddea4f7685a5de45e0f5d7fe829e416d2001d6bf777cbf648e982f98","observation_id":"18cd1628-2a4b-4354-868e-acbceb063b63","resolution":{"observed_at":"2026-08-05T23:29:15.024275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:15.137929Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.137929Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:f32688beebda95b406210907bb646b2f833a39f3578c9d24261ebea44fa4fa0f","observation_id":"9231b1b3-8ec4-4a54-9baa-29eb6e09b9dc","resolution":{"observed_at":"2026-08-05T23:29:15.137929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:15.264012Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.264012Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:300f52b3ba04f96f632627e3c97e60efb7951e0e92492d7f97a05f183ce2ba7f","observation_id":"ad0ade1a-1244-40c8-b05e-4bc7fdd1d6a3","resolution":{"observed_at":"2026-08-05T23:29:15.264012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:15.392526Z","title":"Scemqa: A scientific college entrance level multimodal question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.392526Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:602c460f3a44f6c89e35dbf4f151623083874e3707e59b1911612ee3ef3a69cb","observation_id":"4bbd3274-5a24-4402-afc5-6da961b84d39","resolution":{"observed_at":"2026-08-05T23:29:15.392526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12199","last_updated":"2023-05-20T14:13:08Z","snapshot_observed_at":"2026-08-21T14:50:47.981971Z","submitted_at":"2023-05-20T14:13:08Z","title":"VNHSGE: VietNamese High School Graduation Examination Dataset for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12199","snapshot_observed_at":"2026-08-05T23:29:15.552942Z","title":"Vnhsge: Vietnamese high school graduation examination dataset for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.552942Z"},"links":{"cited_paper":"/paper/2305.12199","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:4c8f98f26c09c73a61fc9aee18d91753d3e06c07da1829b37dbb79cc64b5ffde","observation_id":"29b6a9d1-578d-4c3e-a2fa-cfa6d2e16e32","resolution":{"observed_at":"2026-08-05T23:29:15.552942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:15.664277Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.664277Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:d0a3c37306ae61667468b5aef3736f3bcfd21ece08f400c0d3a9d4671f77599d","observation_id":"242b9482-5532-4ca9-b0a8-f34ff3e88156","resolution":{"observed_at":"2026-08-05T23:29:15.664277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05232","last_updated":"2026-06-05T07:00:46Z","snapshot_observed_at":"2026-08-20T18:11:14.265934Z","submitted_at":"2025-05-08T13:26:33Z","title":"ChemQuests: A Curated Chemistry Question-Answer Database Extracted from ChemRxiv papers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05232","snapshot_observed_at":"2026-08-05T23:29:15.787610Z","title":"Chemrxivquest: A curated chemistry question-answer database extracted from chemrxiv preprints.arXiv preprint arXiv:2505.05232, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.787610Z"},"links":{"cited_paper":"/paper/2505.05232","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:5c0815c42d3aee2db226b4cbadfb66341f24c8965c56a16246b5d597fedf73c9","observation_id":"2c71bf73-9339-4b45-8e0b-b473c37bc94d","resolution":{"observed_at":"2026-08-05T23:29:15.787610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:15.903931Z","title":"Evaluating the symbol binding ability of large language models for multiple-choice questions in vietnamese general education","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:15.903931Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:b035e6e13ccf516c58c1f31e8537d8182e1dbe30b95a8c3ebe9c496b1bda08e2","observation_id":"2d9b7562-70e3-4b43-8bd4-31a4e10348c3","resolution":{"observed_at":"2026-08-05T23:29:15.903931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-05T23:29:16.036443Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.036443Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:deb67d4f398a44639b4958056952911a6a56325d15a4f2ef06b071086e8ed46b","observation_id":"48e8fdc2-78e4-493b-8bf5-b8d8d4134587","resolution":{"observed_at":"2026-08-05T23:29:16.036443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:16.106388Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.106388Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:5adb379e5de526894e76b058e5a7345e7ab7bd1dbb3baf406e51a3e27c51228d","observation_id":"fc2651ec-3676-420e-bd47-10df60088fe7","resolution":{"observed_at":"2026-08-05T23:29:16.106388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T23:29:16.170654Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.170654Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:c927b9922582c0a1fc14f7a1c08653f2d3a583fd6371070d38d8b761518e7ae7","observation_id":"dc0e6dd3-3e5a-460d-9af1-a39a376e33f0","resolution":{"observed_at":"2026-08-05T23:29:16.170654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-19T07:59:58.721057Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-05T23:29:16.338406Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.338406Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:72db617b7c7cc2bb32b970212c05abe93f016caddabd21c45a018e7a6e4e2374","observation_id":"1e7e4c2b-afef-4f04-8e41-48b0bdee1539","resolution":{"observed_at":"2026-08-05T23:29:16.338406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-16T12:42:16.250629Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-05T23:29:16.461188Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.461188Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:2638353116bbea024bffea19f2d021b5cb0794ad6aaa06b6178e56a9f1bffc0c","observation_id":"ca86a00a-d62e-4365-a261-53a173b04924","resolution":{"observed_at":"2026-08-05T23:29:16.461188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-14T19:11:11.139675Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-05T23:29:16.503129Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.503129Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:571481e63b37865c19206cce645faf57b395b1d4251d406e139a00ae0c945129","observation_id":"e138b8bc-4358-41a5-ad59-8ba1c35ef888","resolution":{"observed_at":"2026-08-05T23:29:16.503129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T23:29:16.575673Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.575673Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:a46efbd0d93158edaa4449b51c867a40e90e479cfd097d0d6b383e6d091cce7c","observation_id":"f123ce55-4bbd-4388-82a6-b03a540296aa","resolution":{"observed_at":"2026-08-05T23:29:16.575673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T23:29:16.646941Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.646941Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:11627c7f6de56eb5dcbf1f249f8cd363e09b7dbe313fa93e0f7e8b888d731aac","observation_id":"d551d9dd-76e3-45e6-81fb-cf68ba2e104f","resolution":{"observed_at":"2026-08-05T23:29:16.646941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-08-17T16:40:23.847561Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-05T23:29:16.703242Z","title":"Demystifying long chain-of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.703242Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:0a657626a41f6f5fd001dd1b12fcfebf7b7adc7db0841a21a7dddcdd3f24ab94","observation_id":"56d5df1a-0304-408c-9ae2-c3c583c00b7b","resolution":{"observed_at":"2026-08-05T23:29:16.703242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:16.707048Z","title":"Open r1: A fully open reproduction of deepseek-r1, january 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.707048Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:f81f606e9f0af4856e9b4bcabc370b39fe78603820f45cd7bf32eb8f5ca27bfd","observation_id":"fd7b64ca-ab64-45e6-ad91-8132ecccf183","resolution":{"observed_at":"2026-08-05T23:29:16.707048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02587","last_updated":"2025-04-04T01:07:06Z","snapshot_observed_at":"2026-08-16T12:44:16.063434Z","submitted_at":"2025-04-03T13:53:28Z","title":"Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02587","snapshot_observed_at":"2026-08-05T23:29:16.745968Z","title":"Rethinking rl scaling for vision language models: A transparent, from-scratch framework and comprehensive evaluation scheme.arXiv preprint arXiv:2504.02587, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.745968Z"},"links":{"cited_paper":"/paper/2504.02587","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:e629c72f288a0ddaa4e090a94e84e03e14f2f9f1cecbad2bd47dde6a88552da7","observation_id":"a00dfc3d-725a-4f49-ba37-4f81fabc7e24","resolution":{"observed_at":"2026-08-05T23:29:16.745968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T23:29:16.807447Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.807447Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:c268f4270544694460309f8eac06f7266ba74abb4b66810230200e6216f8df57","observation_id":"fdd19e39-4745-4c4a-990f-a61fd25109b0","resolution":{"observed_at":"2026-08-05T23:29:16.807447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-08-17T11:15:45.055944Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T23:29:16.856632Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning.arXiv preprint arXiv:2504.08837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.856632Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:b1a851ee30de8704a08c171a117f0e29eef5a3ae8db0f74e3c02aed6eb2347ee","observation_id":"da953aed-ea43-48d5-a0f7-abd7a5884468","resolution":{"observed_at":"2026-08-05T23:29:16.856632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:29:16.968225Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.968225Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:4a356d979e403670f74bbf99f0178ca2b92a1a30348113a8f79d7732b026e36b","observation_id":"0cda74db-115e-4711-927d-1919d9f1a0fb","resolution":{"observed_at":"2026-08-05T23:29:16.968225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-17T08:14:26.874860Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-05T23:29:17.022564Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers.arXiv preprint arXiv:2506.18254, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.022564Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:b45c648fcbaa4bc3ae4bf18abd171991db334c975de28329966e81a167dbb5e4","observation_id":"8969b9a4-7393-42e5-95c1-4d046f3c9338","resolution":{"observed_at":"2026-08-05T23:29:17.022564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:17.076702Z","title":"Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models.arXiv preprint arXiv:2504.09696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.076702Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:c80dd094d96e612467f53365dd4ea6fe8613cd2ea608b034883bee17a18c0409","observation_id":"9b1af818-1681-4458-bc65-be417c1fb148","resolution":{"observed_at":"2026-08-05T23:29:17.076702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-22T03:52:53.469568Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T23:29:17.079340Z","title":"Math- shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.079340Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:df3247a9860b99aa6ff6cf94156c63f35c4ca05b88dfea13665ca6ee7332236e","observation_id":"28beb4d5-350f-44e3-a2c8-bcf574f38a30","resolution":{"observed_at":"2026-08-05T23:29:17.079340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-05T23:29:17.082217Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking.arXiv preprint arXiv:2501.04519, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.082217Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:884de9cb44b8bfa009ae7df32a1d6fe3cc141c42c2498ab6161f38a3b8e871fb","observation_id":"9f30538b-8588-4cba-add5-7cc3256747de","resolution":{"observed_at":"2026-08-05T23:29:17.082217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-19T04:31:32.004381Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T23:29:17.085079Z","title":"R-prm: Reasoning-driven process reward modeling.arXiv preprint arXiv:2503.21295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.085079Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:0e0ebbb75e50b175ccf506910a9ba8ddc8d2f8cb517f9586182bb95c775d150f","observation_id":"718a23d0-7989-4f4c-9022-a75a6ae2d9d8","resolution":{"observed_at":"2026-08-05T23:29:17.085079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13427","last_updated":"2025-06-05T05:29:41Z","snapshot_observed_at":"2026-08-16T02:17:25.109640Z","submitted_at":"2025-05-19T17:55:08Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13427","snapshot_observed_at":"2026-08-05T23:29:17.087874Z","title":"Mm-prm: Enhancing multimodal mathematical reasoning with scalable step-level supervision.arXiv preprint arXiv:2505.13427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.087874Z"},"links":{"cited_paper":"/paper/2505.13427","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:7887bd91067aa25f724371dcc55bc29e57a7d93584e05ed8b48e7ff7ec133e2b","observation_id":"875fc884-4447-4b56-a5d6-a8046ecc9574","resolution":{"observed_at":"2026-08-05T23:29:17.087874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:17.090613Z","title":"Reasonflux-prm: Trajectory-aware prms for long chain-of-thought reasoning in llms.arXiv preprint arXiv:2506.18896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.090613Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:cbad05958160d96a04b918f6c4aafb144b1be010d32d8a7ad9ef348c402f4d68","observation_id":"47e5b366-9243-453c-a533-9142e13422e2","resolution":{"observed_at":"2026-08-05T23:29:17.090613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-18T04:53:42.954410Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-05T23:29:17.093775Z","title":"Judgelm: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.093775Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:d4e5d4fe7d53aade616f8414008219f84c23fccba36b618d76e2ec6219e34f73","observation_id":"73badfde-fc94-4126-a8ee-a7377e5d6975","resolution":{"observed_at":"2026-08-05T23:29:17.093775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:17.096872Z","title":"Rm-r1: Reward modeling as reasoning.arXiv preprint arXiv:2505.02387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.096872Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:c8e64dbafce38ce6ed4d4d3da481557fe32205223e8afc168532a00e35cc00a8","observation_id":"62a5a20b-5f9b-40b0-8555-230aa236155b","resolution":{"observed_at":"2026-08-05T23:29:17.096872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:29:17.099452Z","title":"Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.099452Z"},"links":{"citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:7c96eaea7447a0d833d89928b7922568fdedaf9ae6cee5e9d33415751b4c535c","observation_id":"0e9bb82c-f8a2-4e86-8f86-93fc22aa75d7","resolution":{"observed_at":"2026-08-05T23:29:17.099452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16712","last_updated":"2025-06-20T03:10:52Z","snapshot_observed_at":"2026-08-19T01:14:08.902161Z","submitted_at":"2025-06-20T03:10:52Z","title":"ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16712","snapshot_observed_at":"2026-08-05T23:29:17.102230Z","title":"Reasongrm: Enhancing generative reward models through large reasoning models.arXiv preprint arXiv:2506.16712, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.102230Z"},"links":{"cited_paper":"/paper/2506.16712","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:37d09711c17735a7df922a8f3095a0fd4f39ea9374b62965745acb59f3c77cb3","observation_id":"fa019db4-f9cb-4ba2-9b10-625f4ed9f6b5","resolution":{"observed_at":"2026-08-05T23:29:17.102230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T02:43:13.171373Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2508.05383."}