{"as_of":"2026-08-07T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b95101d91bd6e8c550a9d008da1e899d375bc6d35dbeedd0c39e313d9fd41b7","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:48:37.725055Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:35:11.261146Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-06T11:35:11.261146Z","title":"Grpo-care: Consistency-aware reinforcement learning for multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-06T11:35:06.948357Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:11.261146Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:5e1e67ba9dca63fa3d710d00ea87f1c3079da7843bb06f09b24e3fe0cac2c293","observation_id":"98c1c08e-f4f6-4914-8582-a873fff20c39","resolution":{"observed_at":"2026-08-06T11:35:11.261146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T23:43:03.419373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.419373Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:9f81185664f02bd0a265d74961f9d01a96def95f6708adc8262922e0b1da8ff8","observation_id":"ac8c59c9-589e-4ac1-9487-00d555b75867","resolution":{"observed_at":"2026-08-05T23:43:03.419373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-03T16:56:03.428939Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:1da8eadb25b59bb089cc879c061d4374288ce7552b51475bdd2f7392a50259aa","observation_id":"ea14883e-98a6-4fb9-9ef4-a8371292709f","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.03485","last_updated":"2026-05-05T08:20:48Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T08:20:48Z","title":"MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T01:20:54.441367Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.03485"},"observation_digest":"sha256:5bcdf32eed647a7b00217004b0f3fa6b582bf5fcbbd8df60a46491fbaaca7ccc","observation_id":"ba0bfcdd-be2f-4489-b396-47970bb67ef4","resolution":{"observed_at":"2026-05-11T23:11:15.673718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.13641","last_updated":"2026-05-13T15:05:18Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:05:18Z","title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:24:05.375951Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.13641"},"observation_digest":"sha256:46f0621dccb2f6e46e8978aa08b3c0f5727bb667f3086846e29ee9b84244430c","observation_id":"e9c14120-8beb-4b12-8b0b-274c4bf4b9d0","resolution":{"observed_at":"2026-05-14T19:27:51.300574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.21801","last_updated":"2026-05-20T22:59:02Z","snapshot_observed_at":"2026-07-31T22:43:35.705855Z","submitted_at":"2026-05-20T22:59:02Z","title":"Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T08:53:02.051453Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.21801"},"observation_digest":"sha256:6dd94c47ad17a6925687e642fa9cf55cdb9450b069c615423522359ba1e288a8","observation_id":"f3429f25-bb38-4d17-b2ff-70b78648a36c","resolution":{"observed_at":"2026-05-22T08:54:45.752486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.26680","last_updated":"2026-05-26T08:16:16Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:16:16Z","title":"DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T17:50:00.740770Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.26680"},"observation_digest":"sha256:e7db60b8a0c1f7129228db50443e9800e66851b7ffdde5553e5e643211a8ac1b","observation_id":"9b56a2e3-91fe-42c4-a10f-3c2b1b66a312","resolution":{"observed_at":"2026-06-29T17:53:47.092273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2605.27154","last_updated":"2026-05-26T15:14:56Z","snapshot_observed_at":"2026-08-07T10:04:02.774395Z","submitted_at":"2026-05-26T15:14:56Z","title":"Touch-R1: Reinforcing Touch Reasoning in MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:55:05.919049Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2605.27154"},"observation_digest":"sha256:5af55b2ca52c7de19d65b32e8fbec9222d1572d78ca00022e5e9b65d99e2b1f3","observation_id":"14e8d7db-96f7-45bf-99ff-3b55098fb9db","resolution":{"observed_at":"2026-06-29T19:03:51.639487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:59a39d2c34e423a2ee317db26def537822808c7cd74ad1db5135d57536216404","observation_id":"7dbb6506-44d7-4151-a07d-775cf052e55e","resolution":{"observed_at":"2026-07-01T22:26:17.320768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:5f0face0bae84c9b64ad10f9555a91b60ab582b1bfe425e1e9c1bb0cb21382ff","observation_id":"1ef5e2ec-7c53-4b66-8092-847994b7ba01","resolution":{"observed_at":"2026-06-30T10:44:36.816892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.18988","last_updated":"2026-06-17T12:08:20Z","snapshot_observed_at":"2026-08-06T08:59:20.055779Z","submitted_at":"2026-06-17T12:08:20Z","title":"ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:58:30.855338Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.18988"},"observation_digest":"sha256:7e7c65c3e992b091cb5e5bc0661b5ca766568699e271dada622a90235b84379d","observation_id":"d4b025b0-8a22-45d5-aae7-e2db5fb881f0","resolution":{"observed_at":"2026-07-04T00:49:18.252360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.16141","doi":"10.48550/arxiv.2506.16141","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grpo- care: Consistency-aware reinforcement learning for multimodal reasoning","venue":"ArXiv.org","work_id":"41a7dfb7-5564-4132-89bf-b7301ad2fd75","year":2025},"citing_paper":{"arxiv_id":"2606.30217","last_updated":"2026-06-29T12:30:24Z","snapshot_observed_at":"2026-08-03T23:12:01.383471Z","submitted_at":"2026-06-29T12:30:24Z","title":"Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T05:55:19.083517Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2606.30217"},"observation_digest":"sha256:acc768df10ed1a862af9f5eab9589d62b733e440d2bef27901297a1de5bda254","observation_id":"d83f06a3-2c79-4a41-b0bd-fc3c6771115c","resolution":{"observed_at":"2026-06-30T13:34:41.169558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16141","snapshot_observed_at":"2026-07-14T14:00:00.388339Z","title":"arXiv preprint arXiv:2506.16141 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10147","last_updated":"2026-07-11T06:15:03Z","snapshot_observed_at":"2026-08-07T02:35:47.571845Z","submitted_at":"2026-07-11T06:15:03Z","title":"REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:00.388339Z"},"links":{"cited_paper":"/paper/2506.16141","citing_paper":"/paper/2607.10147"},"observation_digest":"sha256:2297ca9998cffff7278d890847e497743895939140e2df686b29fc1cef8d40da","observation_id":"ad9f6d09-1dc7-4dd0-9c3c-8b7df3220910","resolution":{"observed_at":"2026-07-14T14:00:00.388339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16141/citation-record","integrity":"/paper/2506.16141/integrity","json":"/paper/2506.16141/citation-record.json","paper":"/paper/2506.16141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:48:32.974881Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:32.974881Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6728d5db3021a0ac9fff6d2d53adb1a5c6b5185f8dc2c5d72557f369694d850b","observation_id":"1f1d5302-beb0-423c-96f4-79e6943e7596","resolution":{"observed_at":"2026-08-06T23:48:32.974881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:41.031431Z","title":null,"venue":null,"work_id":"62f2db28-ada0-495e-8db3-3a54647f2cf7","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.018546Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:ea7f1a234cdc0b99918e2c9ec255709b3369cc2c16305cd93e2bea8e579271d5","observation_id":"24167e82-b909-4652-9040-1d7369cbefcb","resolution":{"observed_at":"2026-08-06T23:48:41.128978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T23:48:33.083995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.083995Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:95313ec08d75b7c9d47ac281de3ef71335bbb487a09a4f12210630537b0c16be","observation_id":"96bc01f3-3303-4e46-94cd-badd1d66a95a","resolution":{"observed_at":"2026-08-06T23:48:33.083995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:48:33.164335Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.164335Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:9332313932acd9a1a9df228de1e0b23d6841920f02d3ed0ed2ce00f51aed6c2f","observation_id":"07a8d6fe-123a-4013-9744-9ef7209e42e7","resolution":{"observed_at":"2026-08-06T23:48:33.164335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:33.223889Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.223889Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:84f246eb7b58c98ce7224657b37bb1ea89a55e6ea5236c4037a5174aa698b0c6","observation_id":"7aedcf7f-19ce-4c21-afc1-14879ba2e61c","resolution":{"observed_at":"2026-08-06T23:48:33.223889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T23:48:33.343894Z","title":"Demystifying long chain-of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.343894Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:8402640920f403ac285bf6458bc855321c41d938b0510bed70f2b1d5213fcd9c","observation_id":"87668594-5f01-4f8b-87d3-d9f12a73318e","resolution":{"observed_at":"2026-08-06T23:48:33.343894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T23:48:33.451030Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.451030Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f1584a6caa898304c1b0863a8474b947a54b1056122fb1712492f46bae6d3e92","observation_id":"7ba8fcbb-2e6b-49cc-a7f8-6b01284932df","resolution":{"observed_at":"2026-08-06T23:48:33.451030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T23:48:33.585809Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.585809Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a03d1e1f9600a193c153d162cd837c82ffa5f48db3b5da1cd0fbbbc30956ba0e","observation_id":"f1dcbb12-835c-47db-b815-97acdf0acfd0","resolution":{"observed_at":"2026-08-06T23:48:33.585809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T23:48:33.702470Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.702470Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:1298e1deed6a59ac7bda8ea5953e38ccd7dc8056ca6d6be0ae2e7c2634dd4393","observation_id":"4d460403-1db4-4434-a36a-5a883226b3fc","resolution":{"observed_at":"2026-08-06T23:48:33.702470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T23:48:33.790717Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.790717Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:fc69296929df85d3af15007fc28287cb7e57df2d8fd83700dfd075e1d5e5932a","observation_id":"01639783-15c5-441b-99d6-50825f3a2196","resolution":{"observed_at":"2026-08-06T23:48:33.790717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.743950Z","title":"Video-r1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":"aac97677-7fb9-4a8b-9eef-8f207d86ff72","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.849002Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:635486b180658e7d4df2ed3843e56cbb6ff6c32be68fcc07550d4bcd9b52d3da","observation_id":"3e860905-a7be-4343-940b-cca4e68e3f50","resolution":{"observed_at":"2026-08-06T23:48:40.869684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T23:48:33.921347Z","title":"Egoplan-bench: Benchmarking multimodal large language models for human-level planning.arXiv preprint arXiv:2312.06722, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.921347Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:ac6d1a44d7f441d6903a60813431da7dc02bb2048e8ee271603a4d87d4dc97e8","observation_id":"1b678cb0-2ede-464c-a21e-6c7e4010fef8","resolution":{"observed_at":"2026-08-06T23:48:33.921347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-06T02:13:58.479161Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04447","snapshot_observed_at":"2026-08-06T23:48:33.993024Z","title":"Egoplan-bench2: A benchmark for multimodal large language model planning in real-world scenarios.arXiv preprint arXiv:2412.04447, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:33.993024Z"},"links":{"cited_paper":"/paper/2412.04447","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:cf1cde1a4ce905a8019d7e84fa50ec96e1dff1b870383729f9c3d0ad6d55bcd6","observation_id":"fed62ce0-a034-485a-bf36-63085f2fbbd6","resolution":{"observed_at":"2026-08-06T23:48:33.993024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.554461Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"49e0dc71-7d79-403f-bda3-25fc0e9f8690","year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.042645Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:23c591a219cff3bd5a8991f0a2d40afc47d7c54b0027dcfd629b575bf35054e2","observation_id":"caef7470-ac90-4e9c-8f9c-ee95ebbe62f4","resolution":{"observed_at":"2026-08-06T23:48:40.652360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.135877Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.135877Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a58909f99b985051bf07900d05088e6721e1ba484794fd539cf1d2b479871aff","observation_id":"5ff65fe0-73c8-4310-8e5b-87392040dbc7","resolution":{"observed_at":"2026-08-06T23:48:34.135877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.294811Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":"39c927c9-e8f5-482b-bef7-f8f0840c8a32","year":2017},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.212172Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:d557b1688720f8c2346dc18784002c6f961f6976a24c4ac43d62c6eb7bd8bcb5","observation_id":"f9c40393-dab8-4541-82f8-5cca8d1246b1","resolution":{"observed_at":"2026-08-06T23:48:40.372247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.320914Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.320914Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:902d8ef48b07bd5bba37e96b01665c41794d4d27de3c0e2c62bd9a35b6c8ba64","observation_id":"ba36716a-bc1f-4057-bbe6-55210a24beae","resolution":{"observed_at":"2026-08-06T23:48:34.320914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T23:48:34.438236Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.438236Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:980120a21c0f4bbf5c8960e96b891daa071327390fa9147f0dc781a136ea1551","observation_id":"e55eb96e-5451-4977-8298-c7ca82c2048c","resolution":{"observed_at":"2026-08-06T23:48:34.438236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:34.522538Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.522538Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f76cb155e616af5379a908b86f0f41dabdfab0854553cf84ef38fe8fb618d7d3","observation_id":"55dc7406-8b3a-440b-b8c9-44bd12456a59","resolution":{"observed_at":"2026-08-06T23:48:34.522538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T23:48:34.603403Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.603403Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:00a213d9de605c6937e7772018c7abc647f7f08ad416a5c03a4c083e8459b962","observation_id":"0924cf59-4514-4f59-8d31-deddba17e0f4","resolution":{"observed_at":"2026-08-06T23:48:34.603403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:40.053035Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"ed44a5a7-64b0-473e-a701-af17355a638a","year":null},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.660272Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:cfc57516ae73655049451d9afdb9a94d0f5e7fc184d31638108e1722a0c23c3b","observation_id":"703c21e7-fa80-4e50-8baa-1a99f975d6ab","resolution":{"observed_at":"2026-08-06T23:48:40.165451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T23:48:34.742575Z","title":"Improve mathematical reasoning in language models by automated process supervision.arXiv preprint arXiv:2406.06592, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.742575Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6f0421b0ca2593d2ba4098b0cc5c3069055d712437747fe3be94b7771d891f3f","observation_id":"210ad232-6d95-4711-a1dd-85c5fe2758f7","resolution":{"observed_at":"2026-08-06T23:48:34.742575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T23:48:34.838198Z","title":"Math-shepherd: A label-free step-by-step verifier for llms in mathematical reasoning.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.838198Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:601cdb4053fe5a2566ee8b2ba58cd5171a3b693fe169ba499003c538ac861699","observation_id":"0feb8827-418f-418e-8da2-a7028c875bb9","resolution":{"observed_at":"2026-08-06T23:48:34.838198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14024","last_updated":"2024-10-18T06:59:24Z","snapshot_observed_at":"2026-08-06T13:33:28.979461Z","submitted_at":"2024-06-20T06:42:27Z","title":"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14024","snapshot_observed_at":"2026-08-06T23:48:34.894129Z","title":"Llm critics help catch bugs in mathematics: Towards a better mathematical verifier with natural language feedback.arXiv preprint arXiv:2406.14024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.894129Z"},"links":{"cited_paper":"/paper/2406.14024","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:fd6c014429e373b42847365b5f385a63a57d3c535405e445c754e4c9ec1c0603","observation_id":"3e166373-3cab-4d7d-93c9-1559829a576c","resolution":{"observed_at":"2026-08-06T23:48:34.894129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.865522Z","title":"Evaluating mathematical reasoning beyond accuracy","venue":null,"work_id":"69f51e75-a7b6-4057-b3d9-1f144bbdf9d5","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:34.955288Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:ebe9911c1089be0dd6384c441c7f1953310f5dc1595ec3a1efc7a03da87eba36","observation_id":"4249718d-264d-47b1-9722-2ef4abd5d1ae","resolution":{"observed_at":"2026-08-06T23:48:39.929136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T23:48:35.066396Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.066396Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:af80af4585f639d62d2fff65b6fe385516de70f9423478b988a84ec2dcb29121","observation_id":"97e55492-936f-4c0e-a906-accf45d41bb2","resolution":{"observed_at":"2026-08-06T23:48:35.066396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.565271Z","title":"Warp: On the benefits of weight averaged rewarded policies, 2024","venue":null,"work_id":"513e3b97-e06b-4ee5-be47-e4ddbbd394f1","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.168865Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:2f5fca82feb526f6636ce2838ac3fd958af60ef26e0a8ee8a42e3b00310d09dd","observation_id":"82a53331-fc24-45c0-93c9-e2aad67d13f5","resolution":{"observed_at":"2026-08-06T23:48:39.715436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.276903Z","title":"Gtr: Guided thought reinforcement prevents thought collapse in rl-based vlm agent training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.276903Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:1cca10f90443300db6a33736933d98c302f7ebd53fcc0ba4b3b31db6621afd91","observation_id":"3a7d7d8c-b443-443e-a03b-13792fd8bef1","resolution":{"observed_at":"2026-08-06T23:48:35.276903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.333605Z","title":"Mm-math: Advancing multimodal math evaluation with process evaluation and fine-grained classification","venue":null,"work_id":"8e44fee7-4802-42e9-b1ca-b6708c8523b1","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.459609Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:6bf702822e4589048a7b57e23c33f78e3b97eb14ca4495b00bf33b26794efdf0","observation_id":"c747885d-dd23-4ad6-9ada-f9fdd4f839b3","resolution":{"observed_at":"2026-08-06T23:48:39.435084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.141030Z","title":"Open-r1-video","venue":null,"work_id":"92107a28-f11a-4bf9-8f3c-02a845455d5b","year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.524033Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f0967757853c9584aabd58ad1659b7b46841c94c8e0639b9363ba9f81bd9bd60","observation_id":"5527d3f9-a4c7-4a69-9141-87eaf4ece1dc","resolution":{"observed_at":"2026-08-06T23:48:39.241098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T17:22:15.100571Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-06T23:48:35.612776Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcing learning.arXiv preprint arXiv:2503.05379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.612776Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:be0c4c83a4134aa4762e072946579dc1ff0c8a0b90e680805b4de0e02a6ed789","observation_id":"f4b54ff6-e282-4069-af2e-5c4dee1f3d62","resolution":{"observed_at":"2026-08-06T23:48:35.612776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.918087Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild","venue":null,"work_id":"d20eae35-e49b-4a4e-9dc5-7854798fd3fd","year":2022},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.679709Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:f0515c84f4620057cf2671d9559570c4ce014f57aac93d782cc08a99bc10cbc2","observation_id":"4042c7ab-253b-407c-887f-31b9ae9694a2","resolution":{"observed_at":"2026-08-06T23:48:39.023697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.733969Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild","venue":null,"work_id":"b8fd6833-200b-4e37-afa6-b650300efc1f","year":2020},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.767077Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a0cf71410c793c4dfe1e3b719a9348148a8b2554f52876623da1b176ded8c681","observation_id":"e7c72394-096f-4d90-8344-71c77b1bb301","resolution":{"observed_at":"2026-08-06T23:48:38.821362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.861496Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37:28828–28857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.861496Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:d2d83c7277602890ec52e98fe93ef9ec0ee82c6d61c98b677f3ba2eccd541a3e","observation_id":"a0df6ca4-fdf4-447a-850d-7e9688d04544","resolution":{"observed_at":"2026-08-06T23:48:35.861496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:35.947030Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:35.947030Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:5c1da4ae8ba7f8eb1e2a1ac9131bda777369cb0323b950f6f48988fb1996d303","observation_id":"22a0426f-ac6a-4cdc-933e-c641f0d5a4d0","resolution":{"observed_at":"2026-08-06T23:48:35.947030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:38.476191Z","title":"Tempcompass: Do video llms really understand videos? InFindings of the Association for Computational Linguistics ACL 2024, pages 8731–8772, 2024","venue":null,"work_id":"807bb7c4-5fa3-4f78-9207-5ef9532805fd","year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.039772Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:e6713ad0aebf5f31b4d12064f954511c1251c628958eb0ee69c0bd5f31808cc9","observation_id":"db357cd1-ea01-459b-945c-e6a9cfcee43c","resolution":{"observed_at":"2026-08-06T23:48:38.593156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.245848Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.245848Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:1ff767abf10353bdb4dce4817757cf9b6d6699a665ab4c31060f0be4e6b643bb","observation_id":"b6b4a07a-446e-465a-b0b2-fc16fed427ae","resolution":{"observed_at":"2026-08-06T23:48:36.245848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:48:36.371774Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.371774Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:91a887775dd28c1e42bc67a4f76f79cc50ea5ce4d285031a85c96cbdc065e430","observation_id":"8120ea48-5a60-4ed9-b67c-264cbe53d991","resolution":{"observed_at":"2026-08-06T23:48:36.371774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T23:48:36.504016Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.504016Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:166832e10880787aec413915277565b0a8e0dd8cc06c495dc8696d6ae4c13913","observation_id":"d1bee5ad-baba-454a-9bb7-b7384a0c64e1","resolution":{"observed_at":"2026-08-06T23:48:36.504016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.600274Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.600274Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:eb72858764d5dbc2cb910d31c90687156391ebed699c172e56809a7054119ca2","observation_id":"52bd632d-3da6-4f60-8a1d-5a5eb892d476","resolution":{"observed_at":"2026-08-06T23:48:36.600274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T23:48:36.680253Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.680253Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:b3ad0d9636ac60efdf3785fb6c1b1d8d755aa9e18fa413b2d0d173f564e47f81","observation_id":"9fa98f0e-5053-4c37-abe0-bb1c03d95e62","resolution":{"observed_at":"2026-08-06T23:48:36.680253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:48:36.814956Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.814956Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:45f26f7696a0fbbc1f2fb75ab7e8572c7b4ceb143609a6203bdf898ae3715c16","observation_id":"0b8f8ce4-9400-4786-81bd-7c484317d5cc","resolution":{"observed_at":"2026-08-06T23:48:36.814956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:36.999749Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.999749Z"},"links":{"citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:e68374a674e9c55d7c7a5b133812e01876c67a01fb0cb1cbb56e968fd17fc60f","observation_id":"94c136af-0e49-4990-a1f1-2c94e53f5172","resolution":{"observed_at":"2026-08-06T23:48:36.999749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-07T18:11:33.842031Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-06T23:48:37.181614Z","title":"Unhackable temporal rewarding for scalable video mllms.arXiv preprint arXiv:2502.12081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.181614Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:25f19a9c3ec3bb610e55da21dff14673a15ffd7a00c676ebf71804bc8fa94bf6","observation_id":"847d3506-46b5-4ed4-996a-c47b8e2c793e","resolution":{"observed_at":"2026-08-06T23:48:37.181614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T23:48:37.284629Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.284629Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:a4474ef7e987e855eb82f5c52a06f07510a063376c2cdc2cc6ce6380125bbbba","observation_id":"cd5f36df-dc5c-4131-8cbc-28b81e2c7ef5","resolution":{"observed_at":"2026-08-06T23:48:37.284629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-06T23:48:37.373080Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.373080Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:3e982e8d211c2dc5353e7ba44360ea5b879ab37f2ab2082b63db2745b1e34d3d","observation_id":"d2d036f9-03e3-4183-a4e4-e3dade6832b8","resolution":{"observed_at":"2026-08-06T23:48:37.373080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T23:48:37.464542Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.464542Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:016b371b265e64fc534adc7f5f143f6801869d13ed844e907b605d8a8055e60c","observation_id":"a6198fb0-460d-4309-8991-d026ef49699f","resolution":{"observed_at":"2026-08-06T23:48:37.464542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-06T23:48:37.556314Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.556314Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:cc3187e64912a43583f0bf28644dfc101a76943253fa51d531aaaf13cdb82e78","observation_id":"7e2d0813-3723-406c-9f37-99613b9ef861","resolution":{"observed_at":"2026-08-06T23:48:37.556314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T23:48:37.656075Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.656075Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:20712ca94f55eeb07070afbbcafc7560ac4a61f51d4178bf20a0486e1ac966c5","observation_id":"cfb50d06-db4a-4122-b1a9-f8f7b1410dc9","resolution":{"observed_at":"2026-08-06T23:48:37.656075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T23:48:37.725055Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:37.725055Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:37e8bceab437b1bd609bd65a132e190e46ec93c0c8f61fbae9e97976455c12a2","observation_id":"c93b68ad-4f32-4fad-90d7-69d5909b854a","resolution":{"observed_at":"2026-08-06T23:48:37.725055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T02:35:16.534559Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 13 inbound Pith citation observations for arXiv:2506.16141."}