{"as_of":"2026-08-11T13:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4fc5ee214f6ce8aba607fdf06525ea68696819c83fbd8d5dae79333d5fda56d","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T20:56:07.247122Z","state":"measured"},{"denominator":142,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":142,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":105,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:41.669333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:49:57.434938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T15:34:41.669333Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:41.669333Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:7b716bc427b5a5c74cb3ac11cced6468c7a9b74a9d6f69de4e3df8d0fe1dce2b","observation_id":"34216a65-fbda-4284-9c4c-1b6854591650","resolution":{"observed_at":"2026-08-07T15:34:41.669333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:55:52.695914Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.695914Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c512b4028163ad860404430f091a4d2b8e8f6b6ab3e130293f5fcf716224eb61","observation_id":"5c0dda25-23c1-44e5-9915-fb6ca1751178","resolution":{"observed_at":"2026-08-07T14:55:52.695914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:49:04.492737Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17540","last_updated":"2025-05-23T06:44:26Z","snapshot_observed_at":"2026-08-07T20:36:17.159381Z","submitted_at":"2025-05-23T06:44:26Z","title":"RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:04.492737Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.17540"},"observation_digest":"sha256:9b2317f32dd3fa3af84da23548e1c8c019183f4f63a60197baf70b236b5a5a49","observation_id":"cda6905f-c5b1-4793-87b6-7c120fbe169d","resolution":{"observed_at":"2026-08-07T14:49:04.492737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:31:18.582137Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:18.582137Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:5d2d2e7bac086cae69031ee3a5ac5dc89e570ef8b58690bbf3965bb1bc762991","observation_id":"f889743e-cbc9-441d-a88a-fbc561be813c","resolution":{"observed_at":"2026-08-07T14:31:18.582137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:09:09.154751Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.154751Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:9ce4aae58644f9a9d7b8016bff3ac9cdbdcb054ffee7d6dc4fb5ff4c62db8e6d","observation_id":"553478bb-aace-4b35-baf5-b767d1820f7c","resolution":{"observed_at":"2026-08-07T14:09:09.154751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:02:54.164163Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:54.164163Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:010b218e499c505d63a4ec5363f6f64481d5c850209033c6a1986499be17a77e","observation_id":"5f7eead2-aa70-42dd-8e9d-189cd6d4bd3a","resolution":{"observed_at":"2026-08-07T14:02:54.164163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:8b5a3c0be253bbe127a7d65de9df29c50c6e5a8c3a882a082b61e1af9abf1448","observation_id":"2411361e-59bf-47fc-a2d9-edc8ed537e64","resolution":{"observed_at":"2026-05-19T13:17:18.558866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:16815f1a6f59b91c29a5e5ad189dd73f54145647e2ab505212e7585f2d030b01","observation_id":"be058646-4150-404a-a6f0-1aa8b1fe742d","resolution":{"observed_at":"2026-05-17T05:40:56.067041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T13:22:23.131565Z","title":"Videochat-r1: Enhancing spatio-temporal percep- tion via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.131565Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4680ff04f2c21373569441eac77debea7a327460c51c85a313d9b15ec6ce17fb","observation_id":"0a9a00ae-3fd0-46c2-be4e-a04520f0240e","resolution":{"observed_at":"2026-08-07T13:22:23.131565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T12:48:06.206753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23504","last_updated":"2025-05-29T14:48:10Z","snapshot_observed_at":"2026-08-09T22:53:32.093532Z","submitted_at":"2025-05-29T14:48:10Z","title":"VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.206753Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.23504"},"observation_digest":"sha256:6802085fe3865a6de06216b6ba9672dbafe9b6c4b791c530d229400d2e7d0599","observation_id":"0ed9d90f-79aa-4cec-9f55-8a61297044ca","resolution":{"observed_at":"2026-08-07T12:48:06.206753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:b6f74b79965ce5812c62525a31d300186180b8087f192291561408dcd8e8fea8","observation_id":"bd845bc2-083f-42e8-b64c-5e2e92bbb9f5","resolution":{"observed_at":"2026-05-22T01:05:52.011365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T12:37:44.976247Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-09T00:48:58.339159Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.976247Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e2a57194ed2258f76a7242273e5524e2d20d548bf34a99a6d087e8a5738741eb","observation_id":"059e7857-0160-4348-a977-ab5a86d5b89e","resolution":{"observed_at":"2026-08-07T12:37:44.976247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T12:22:11.468450Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-11T10:44:12.276130Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:11.468450Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:0955c95a616afd034af84df0b36738f21eb4f85c7faeb2ea7667751d4cbedd0a","observation_id":"7c4361f0-b713-4b46-a04a-8ee3ac1a028f","resolution":{"observed_at":"2026-08-07T12:22:11.468450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T11:55:28.670761Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01371","last_updated":"2025-06-02T06:58:43Z","snapshot_observed_at":"2026-08-07T11:41:22.512374Z","submitted_at":"2025-06-02T06:58:43Z","title":"SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:28.670761Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.01371"},"observation_digest":"sha256:4f029c93c74f2f81e0c305c4bfc7be66f76afe805d61a885eb9dbaabdf2a66d5","observation_id":"2c600c9c-ab3a-40f5-b0e5-da9bb6a2016c","resolution":{"observed_at":"2026-08-07T11:55:28.670761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T11:40:12.120821Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.120821Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:51185ae248ca2a221f45d6c9d56468e6e0e07209c09992f1dbb150200594179d","observation_id":"00491f7a-f816-44ec-89d2-873dd68e7f75","resolution":{"observed_at":"2026-08-07T11:40:12.120821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T10:27:05.594716Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.594716Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5a2a4130673f47f97097f25ff598d3cb51bc471dc2a22ce34463de28a268513d","observation_id":"79e302ca-b92a-4cb5-9391-af5c5397bfa4","resolution":{"observed_at":"2026-08-07T10:27:05.594716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T10:25:36.275756Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T23:48:12.277994Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.275756Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:3d5d0d71818f66da97eabe89022dec03b98c8772902822a0e6c90187b177b2de","observation_id":"7e2c5b33-baa2-47ee-8ec1-9c08b265e0d4","resolution":{"observed_at":"2026-08-07T10:25:36.275756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T10:41:50.358423Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05433","last_updated":"2025-06-05T09:13:37Z","snapshot_observed_at":"2026-08-11T00:38:12.716708Z","submitted_at":"2025-06-05T09:13:37Z","title":"Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:50.358423Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.05433"},"observation_digest":"sha256:4f1029d939caf53f8e091594cf1824ffd332da5d24bd319b91e0ca1e10260627","observation_id":"9da0316d-eead-492c-9689-d5a407928dfb","resolution":{"observed_at":"2026-08-07T10:41:50.358423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:43:40.648654Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-11T11:34:16.404599Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.648654Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:30373bd0951f9d3d7abd460cc537c795be270200f01086aa7ed67447e070dd3d","observation_id":"56be8d9d-0980-44d9-8a08-da5276953aa3","resolution":{"observed_at":"2026-08-07T05:43:40.648654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:26:47.157304Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.157304Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:21d5fcae2905f44404afaf6ba1a07bbf69bcecc8b2a9c7e37415050736caf32a","observation_id":"af25d190-2708-432b-b466-11303fba6d59","resolution":{"observed_at":"2026-08-07T05:26:47.157304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2506.08277","last_updated":"2026-05-19T18:07:46Z","snapshot_observed_at":"2026-08-03T17:18:08.881010Z","submitted_at":"2025-06-09T22:48:36Z","title":"Task-conditioned probing of instruction-tuned multimodal LLMs: Region-specific brain alignment patterns under naturalistic stimuli","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T00:02:41.893373Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.08277"},"observation_digest":"sha256:3a2d46fc61aa6fa2a613af8e879e0b76d2c3db9156f9add926bda6aeca837a24","observation_id":"37320b77-74e9-4433-921e-1f4164d9d5ac","resolution":{"observed_at":"2026-05-22T00:04:27.053881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:05:50.381964Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:50.381964Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:508c1b662b19c9fe43063fe6fc71b224851eebb077d2b68fd4def12c26ef377c","observation_id":"85e6105e-b847-47d6-90f3-150fec9a4228","resolution":{"observed_at":"2026-08-07T05:05:50.381964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T04:22:55.898375Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.898375Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:90ef5d573113ac94af7a232a21f91d306a926ce8c1191a5d5c4146a9f81c2675","observation_id":"96a7f6a6-d097-497d-887f-4378e5386efb","resolution":{"observed_at":"2026-08-07T04:22:55.898375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:47:52.705443Z","title":"arXiv:2504.06958","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-11T03:57:37.664844Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.705443Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:cfea396f1ad4f847ecf92662a175c1962175ea1e4f46dd4ae088a328d75f131c","observation_id":"c4bc7e62-d089-4692-9099-0801bb3d77e5","resolution":{"observed_at":"2026-08-06T19:47:52.705443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:31:27.329895Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05386","last_updated":"2026-06-29T17:47:49Z","snapshot_observed_at":"2026-08-06T19:25:14.929252Z","submitted_at":"2025-07-07T18:17:06Z","title":"Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training","version":6},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:31:27.329895Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.05386"},"observation_digest":"sha256:ffd019b7db79e16759f9f95079f8d7fcbf1e811d35d4c529e32e2a7f532f0a17","observation_id":"1c2f0ad6-3756-4909-bd74-6cc5f8cc0ade","resolution":{"observed_at":"2026-08-06T19:31:27.329895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:54:48.153646Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-09T16:57:22.421946Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.153646Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:422341c3d81d43ac9a4f75fa4ff1e6d360411e257c90eb6fe720c5797ccddf5d","observation_id":"9faaa57f-7cfc-4f53-a10a-cf3e13efeb9a","resolution":{"observed_at":"2026-08-06T19:54:48.153646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T00:03:29.917252Z","title":"Videochat-r1: Enhancing spatio-temporal perception via re- inforcement fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:29.917252Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:86fb133d0f604eb3478784e75ff61ffef6e7b64de133eaabacc616c9e353f9c5","observation_id":"1b5c0a99-8510-4849-bb84-3a0c4d6132a3","resolution":{"observed_at":"2026-08-06T00:03:29.917252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T22:01:25.954563Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:25.954563Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.07683"},"observation_digest":"sha256:8cca238d76179a8587c7f2e8c63f2208a4603f959ccf025ed0b10bdef38d7e2a","observation_id":"4b2f041c-56c2-4491-8c7b-7e956d196ed5","resolution":{"observed_at":"2026-08-05T22:01:25.954563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T23:32:18.043392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.043392Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:4f7408c075bb90ef4536729122c83bf1b90d5fb72369b0c24f67550877596bdb","observation_id":"b82daba1-c250-4a89-b780-db46bb8c4e09","resolution":{"observed_at":"2026-08-05T23:32:18.043392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T20:29:11.305339Z","title":"Li et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:11.305339Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:1ce66f5a72955ee2d85a4fc467609871218426869d0c9b1a827014be17bc922e","observation_id":"23cb6696-7f93-4766-a4bf-49a5c7d15e2a","resolution":{"observed_at":"2026-08-05T20:29:11.305339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T19:03:08.739671Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:08.739671Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:6075b70143add53c2ae424ddc8d0dc58555306471611690f8dc987ea13282505","observation_id":"401f72b7-170c-4bda-bf6e-900197acb79d","resolution":{"observed_at":"2026-08-05T19:03:08.739671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T15:10:16.757814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20478","last_updated":"2026-05-29T09:48:44Z","snapshot_observed_at":"2026-08-10T18:09:36.145325Z","submitted_at":"2025-08-28T06:55:08Z","title":"Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:10:16.757814Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2508.20478"},"observation_digest":"sha256:f52ef6520ac756fcbdd3fbd41f9c36e5531284f9e75936f96fbc426fdd9b6942","observation_id":"5b5dc49a-a1c3-44d3-a5c9-676f2c6b03a1","resolution":{"observed_at":"2026-08-05T15:10:16.757814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-05T12:27:04.966796Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-09T16:17:17.533156Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.966796Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:a7a2a7de807b73fc4142d7120a4877001ed3a6ed942b823063dd5a7054813855","observation_id":"f02cc425-c245-4bfd-a4e3-6ef5769889ee","resolution":{"observed_at":"2026-08-05T12:27:04.966796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":288,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:5092946dfdd651ffc2df16e5145efc4d318385ec178acfdf1902ff0169a76d0f","observation_id":"0069d9b7-6e4f-4340-84fc-ae2d1be8d8c7","resolution":{"observed_at":"2026-05-18T00:02:24.771758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2509.15602","last_updated":"2026-04-16T06:31:32Z","snapshot_observed_at":"2026-08-03T02:26:40.337656Z","submitted_at":"2025-09-19T05:08:05Z","title":"TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T16:40:16.630602Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2509.15602"},"observation_digest":"sha256:02c9133aebead2b1b31b561e75517fa31726a9dd8fde693e0fd7ff1976ede4b2","observation_id":"e23bcd9e-c412-4c1e-8920-f9b1cf979d0b","resolution":{"observed_at":"2026-05-18T16:41:37.838936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-04T09:33:39.319465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.319465Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:f2b3b10bac888437401d190b0e9e586929c95dedab3800c58042267682ba8979","observation_id":"239f54c4-f565-4212-99fa-7e479d963c5c","resolution":{"observed_at":"2026-08-04T09:33:39.319465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-04T09:12:08.076869Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:08.076869Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:9aea6409f85d37314fc55a64e528423bde0581de6a7426c22a1e34f94bab6ce2","observation_id":"0de31263-5f81-451a-b9a4-92328d93d3b8","resolution":{"observed_at":"2026-08-04T09:12:08.076869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-08-09T22:36:48.890275Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:c96295e8243e8e1df500636a615d989078ba2d637ac06508c9ebf11fe81f09dd","observation_id":"19ba47a9-2a76-445d-bb0d-80d45cbb1acc","resolution":{"observed_at":"2026-05-17T22:25:22.662856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2511.18373","last_updated":"2026-04-11T05:44:20Z","snapshot_observed_at":"2026-08-11T05:10:55.239779Z","submitted_at":"2025-11-23T09:43:44Z","title":"MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T05:55:11.495430Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.18373"},"observation_digest":"sha256:cfca3c584cc8297d36b475bc597f2b9519559ca37419c2dadf719dc8c895e30a","observation_id":"c7eb89a7-6f99-44a6-b40e-10bb3b0d5418","resolution":{"observed_at":"2026-05-17T05:59:08.539859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-03T20:23:04.532245Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-03T20:22:57.328566Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:04.532245Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:d57a6ac5458dbb38fccecc0bc41e076c657056038e1c0cffaf410becaea1cd0c","observation_id":"278caf4c-6ebd-4563-beb2-ea12b21b56cc","resolution":{"observed_at":"2026-08-03T20:23:04.532245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:dbe6eb0f9a17d801aecb1063ac81e0872f818bb3f574afb1e4e60b6f285b2e3e","observation_id":"ddf0c330-017f-4c29-bea1-aa1305376dbb","resolution":{"observed_at":"2026-05-22T12:31:32.080338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-10T21:08:10.223339Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:2576a4cafeac64fa8c712563ad8d7d4b04f6fa39d3929afd646a279296ebe205","observation_id":"1cb2b924-c12a-4ca9-96ca-0fca3369f606","resolution":{"observed_at":"2026-05-17T02:11:26.483635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-08-11T03:45:42.619022Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:6e1aa9c3a1a81f7f74e4f23579231e3544bfc380d290304e9c715285f1c5a5b2","observation_id":"272ecf85-534d-471f-9d58-5b4347c00ece","resolution":{"observed_at":"2026-05-17T02:18:52.299074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2512.15693","last_updated":"2026-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:48:26Z","title":"Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T16:43:11.995960Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2512.15693"},"observation_digest":"sha256:685521fcaf2470f170a909c4de5973d92355537e88d969a3c5ea483a305a48fd","observation_id":"ebd662ae-d3aa-4f92-8dd3-71ab58479374","resolution":{"observed_at":"2026-05-21T16:44:15.958395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-09T15:59:03.013255Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:a6ddcaa8a743c3d8a2ee27d642c4c22613f64c79c062a6483664bb3a482f0e22","observation_id":"53febf27-0cf2-4e48-8eeb-49912ad75579","resolution":{"observed_at":"2026-05-16T21:28:34.402101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:340d6b81920166c69d502ab752bdec4d44de7f14f322839b8d10cdf0a7aed372","observation_id":"9d184e8b-ca35-425d-bf8e-48ef6c188f4b","resolution":{"observed_at":"2026-05-16T10:02:42.495434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:ede0e7adc38547b779ccc72a0bb145b23dee7ac0e22ee64c235885a5e607ecba","observation_id":"7b18476e-6052-409e-920d-660b4714a53b","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-02T20:14:04.026500Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-08T13:47:11.850462Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.026500Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:3120ce2ecff0ace211c05d2cba89fb87fb520b13e6bc4d62885b09d4504800a6","observation_id":"e9ed3b7d-bb1c-48e3-8590-3c8bb8682315","resolution":{"observed_at":"2026-08-02T20:14:04.026500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2603.18856","last_updated":"2026-05-07T23:01:31Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T13:00:29Z","title":"Motion-o: Trajectory-Grounded Video Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T08:46:42.967714Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2603.18856"},"observation_digest":"sha256:68bdfe7aed70d2c3ebad06744a09331666c0948b839272aa921f1263b25156cc","observation_id":"f029ec41-1522-4cfe-94a9-50598acb9512","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.01824","last_updated":"2026-05-10T14:15:29Z","snapshot_observed_at":"2026-08-11T12:35:00.734309Z","submitted_at":"2026-04-02T09:35:27Z","title":"STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T21:12:29.596207Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.01824"},"observation_digest":"sha256:351699bb8923bf27f10ebe8f8737b018b1a37506b4421691c7383f11faa79944","observation_id":"4d382b24-8045-4d30-b89e-405acbb2ae25","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.04379","last_updated":"2026-04-06T03:01:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T03:01:52Z","title":"Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T19:40:41.642852Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.04379"},"observation_digest":"sha256:c1a931b13e40fd1f9cb27fe8ee0efd7ef3768d77de62e6050d4c3853456ffce4","observation_id":"34f00026-90a2-4eca-97ae-c5b49e4a8cf3","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:e454f7cf1fd3001fad036da8ebe224b8e3e4a2de7cd8efb4b292f8904bc7c499","observation_id":"77af5656-4bdb-4564-b432-21db53b904c7","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.05079","last_updated":"2026-04-06T18:30:50Z","snapshot_observed_at":"2026-08-11T02:50:08.687959Z","submitted_at":"2026-04-06T18:30:50Z","title":"SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:20:08.590407Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.05079"},"observation_digest":"sha256:bde160a755739bac5090f36bec56fa412f899153f3a33b581dda8d2953b79487","observation_id":"3cc11797-6e60-48af-ac23-67d680bc715b","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-08-11T13:16:43.284900Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:73c680cef0e6ceb723b8d61fd6edcf295022c1f7ced2494d41df02e1be140617","observation_id":"c9098f84-ab77-4cf7-9a18-93b7b1ab0635","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.13715","last_updated":"2026-04-15T10:50:29Z","snapshot_observed_at":"2026-08-03T11:14:47.252184Z","submitted_at":"2026-04-15T10:50:29Z","title":"Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T12:37:17.843365Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.13715"},"observation_digest":"sha256:810ef9af0161fc834f6a607f13866be3dcb0f9211e9b2ce05a95d59c979e7fbe","observation_id":"c8075d91-dd5f-4480-a807-187cccc0518f","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T12:03:09.408019Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:579b5baf997e6493cebf2f649af1352d19ce580e39ab62bfcdd764a7fcaf4205","observation_id":"e545c590-f325-49ad-884f-785c2cdb5d62","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.14692","last_updated":"2026-05-15T12:00:53Z","snapshot_observed_at":"2026-08-03T05:41:26.768501Z","submitted_at":"2026-04-16T06:50:20Z","title":"Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T17:34:10.344111Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.14692"},"observation_digest":"sha256:bc98daaa8eb850459bb2ce3923c7db6a06d96583c0dcc5126d3addcbd381e283","observation_id":"90a97d87-3ad0-480b-8686-b9de36f8e569","resolution":{"observed_at":"2026-05-19T17:37:41.747803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:11633051aa180e2e7fff419ab99e792e6e43f92c5048072bc80bd71a0541c7fa","observation_id":"f95fa5a6-1185-4170-9278-7b5cf2a48a97","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.20473","last_updated":"2026-04-22T12:02:24Z","snapshot_observed_at":"2026-07-30T08:45:43.657043Z","submitted_at":"2026-04-22T12:02:24Z","title":"Video-ToC: Video Tree-of-Cue Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:29.374012Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.20473"},"observation_digest":"sha256:7a1e0d1fe48857c331277508bb0fd7bb1208b16af5c1631bdc2106de3f86cffe","observation_id":"ae99d3ab-70ef-4d78-9908-1c8ea09b7610","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:f3212bcb94c9a69758cbcb76ed441df5865983e5533e255c9ecfc366267644f3","observation_id":"35e59ea5-74f7-4ecf-9c2c-1018e7a83f2c","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.01324","last_updated":"2026-05-05T09:38:12Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T08:41:53Z","title":"Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T14:30:56.297653Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.01324"},"observation_digest":"sha256:607bc7b5fa42f1427f259b88013181e3a8d2e6c268404b5b7722d6e3c3f63760","observation_id":"298cc5d4-2e2a-4be0-a24c-22bba090a0d8","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.04515","last_updated":"2026-05-06T05:48:56Z","snapshot_observed_at":"2026-08-06T20:21:26.793848Z","submitted_at":"2026-05-06T05:48:56Z","title":"From Priors to Perception: Grounding Video-LLMs in Physical Reality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:41:23.233366Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.04515"},"observation_digest":"sha256:e8fbdb6ad3c0ea52e5cac112fda5395c567304e80999497b65f33777dbe1dda9","observation_id":"11afa599-ce7f-4970-a977-cc8a890fa03d","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T14:06:27.953376Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:7c8ba2e77633d4fa39191afead8ab1687710ed07f8205e590a593a0d147a5435","observation_id":"d487b742-4795-40b3-b9b9-98fd84932553","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:41.654207Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:4a3c9c70d0cfd2d5cb712cb78ae994a46b14dbf4e30b545fae7120e7af68de38","observation_id":"d2798d8d-f70f-49da-a34e-c84744afd231","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:59.553683Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:072d6a1b3d167da7d473c3dde16de238e89e37666922b9a4c122d2fb49819cc7","observation_id":"25dcefc6-2205-4ac3-8f2c-0e71b1f10f61","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T06:08:19.956833Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:427289e2332676ffacd51c7adb6c1575b90f7f7d41363c2bd0953e0a318f65eb","observation_id":"6dfabf31-5cd1-42df-85d8-5c72b2de8dc1","resolution":{"observed_at":"2026-05-25T06:10:24.035073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-07-30T14:06:30.177866Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:ff23248a76e1f08973b445d44292c6375c9eef526c8e7669a36e609a42618717","observation_id":"3d089cef-4ebb-49da-9599-7c23c46f5dd5","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.10833","last_updated":"2026-05-11T16:49:38Z","snapshot_observed_at":"2026-08-11T12:40:26.833473Z","submitted_at":"2026-05-11T16:49:38Z","title":"MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:29.463188Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.10833"},"observation_digest":"sha256:b72290a007547f5ab479ef11a22b73194ac84c307593192f5d42bfef8861d7fb","observation_id":"7438fca0-9a81-4291-bb54-64b8093f02db","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.12954","last_updated":"2026-05-13T03:40:21Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T03:40:21Z","title":"AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:43:29.123615Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.12954"},"observation_digest":"sha256:25d64ea7a67bcf90741cdccfb90f92e9d98344bc6294811abe54b5ba03d0e3bb","observation_id":"1e8af7f8-6af5-480f-b5ef-b5f13d186f03","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-11T00:27:38.038120Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:ab8cc0b0baeff436b1ae541f69e6e21a4f50d1f185db1c1ea73199a14b3e31f1","observation_id":"59026968-ea35-4332-85db-263a2d6e1a6b","resolution":{"observed_at":"2026-05-15T20:56:07.931779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-08-06T01:04:24.065010Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:7998254c91721186764d26dbfc6d0d68421a82939bc4a453c8b1642570984c6b","observation_id":"b090bbc6-a4e5-40b9-95dd-473201a05b45","resolution":{"observed_at":"2026-06-30T21:35:04.414548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:1a078bd85a3b1d56c43152d062f1079edeadba7a316390f4198b410e215f79ba","observation_id":"fc5a4d8f-d159-4562-a050-5776a51eb635","resolution":{"observed_at":"2026-05-20T19:38:56.110678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:ff49736fecc235569405690f3f57e3f467f35d9b5d6f29b073d78f26cf642a8a","observation_id":"5cf5bd21-1f17-4c31-a076-f9069932bc32","resolution":{"observed_at":"2026-05-20T05:28:04.421488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T07:32:12.180233Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:0578ecb5d9244a5ba0350d24d535c1e21b6fb6d627426493f94c642dab5a07be","observation_id":"d0f36932-0877-4d83-8c1f-840b20b47bd8","resolution":{"observed_at":"2026-05-21T07:34:02.634001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T08:59:28.405218Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:efb909b469dd042f2ab8efaaea1816649efb90abc732b8919bafaa67eba42ebd","observation_id":"dcd26375-f579-4fbb-a128-30fe1406fc17","resolution":{"observed_at":"2026-05-22T09:01:19.480880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:89f54968ba1edc919716fa372ded514609816bf414ee8106bcb861cda6bd14c2","observation_id":"f405f0e9-49e6-405a-99a9-31353a6283af","resolution":{"observed_at":"2026-05-22T07:21:12.916335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:a98ac91009445ef31716e5c27a8492d8a2b41f4b89b4fe26157b191752196dd4","observation_id":"5d32eb89-951c-4883-8c22-8b87bfdc0195","resolution":{"observed_at":"2026-05-22T07:14:42.493677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:4b107307bdd49886f442959af4ad44b9d7304fa9d97baa36b8a17711ec7c38a3","observation_id":"2fe30dba-9dfb-4ce8-be48-5cfac79a904c","resolution":{"observed_at":"2026-05-22T07:46:14.920464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:f5c3e3723b70b33641aa71ff8ea0baa7b5bb22913402b06ae780f7b29339e3b1","observation_id":"6753f6e8-e03f-4a03-bfc0-89edfc8d4f62","resolution":{"observed_at":"2026-05-25T05:55:24.906324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T04:54:23.077914Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:8fa8a397f2b352c65241be98c24019b5fddea69392cbf213050c6999be30f78f","observation_id":"18ec9111-7679-4de4-a9be-4565ad8735d6","resolution":{"observed_at":"2026-05-25T04:55:23.105864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-04T00:41:02.284215Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:7d6f903748c75db9c00abdb5649e1a2d384794523b3b8553081e1f8932d1ff4a","observation_id":"e65074ca-46b3-42d8-a862-1e983ea558ac","resolution":{"observed_at":"2026-07-04T00:49:17.441865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.26680","last_updated":"2026-05-26T08:16:16Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:16:16Z","title":"DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T17:50:00.740770Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.26680"},"observation_digest":"sha256:76a402e731a74b21fdd8d0e55bd48e0654f1286f2dce308eaa195829627e6abf","observation_id":"ec21962f-3b64-4db1-883d-9015dceab48c","resolution":{"observed_at":"2026-06-29T17:53:47.109477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:a4fbd5ed68cb376ebc59d31f777a10f18915bcb7c7adfc3e0d602027ae3901ea","observation_id":"dc1994c4-aaa5-456c-8f28-57128a758db1","resolution":{"observed_at":"2026-06-29T13:23:28.488984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-08-11T05:22:10.492157Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:0eae69e24960d642e9f3e7183d85f77aaae382fd84d2ccf0b9a4b49e94e2de9b","observation_id":"f36497b5-429f-4978-bb95-23677da03585","resolution":{"observed_at":"2026-07-01T22:56:20.898675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:2f3f7afb24523df951992647d38af028e40ed57e40ced03c509324d216ba4935","observation_id":"556d55e7-8c26-413f-a7a5-2789fbf16a06","resolution":{"observed_at":"2026-07-02T11:56:55.479185Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:e02ff389ecb9393d9de3bb1f98cc6f7e370bcee848db90398c29b41f11e55925","observation_id":"94a384c8-21c9-42f5-a36b-10c117f93309","resolution":{"observed_at":"2026-07-02T12:16:57.732756Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.09181","last_updated":"2026-06-08T08:20:42Z","snapshot_observed_at":"2026-07-06T23:48:35.190418Z","submitted_at":"2026-06-08T08:20:42Z","title":"Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T16:55:35.743040Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.09181"},"observation_digest":"sha256:2314b07cc2ca23a9433a89df484b83c740cbd1ed7ed904e3a7ec0041263aa7d7","observation_id":"7f614dd5-8a08-48aa-ba7d-a4f47eecdcf0","resolution":{"observed_at":"2026-07-03T00:57:30.184032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.18441","last_updated":"2026-06-16T19:42:54Z","snapshot_observed_at":"2026-08-03T17:38:18.858871Z","submitted_at":"2026-06-16T19:42:54Z","title":"Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T01:02:37.632461Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.18441"},"observation_digest":"sha256:b17857487a8333dedaf31ac84560741b6d799ea11e58ffa0db01af6f6fbeaecf","observation_id":"b9d5fb77-a970-443d-956a-c03bc3b0ed74","resolution":{"observed_at":"2026-07-03T20:58:57.736106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.24477","last_updated":"2026-06-23T12:13:19Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T12:13:19Z","title":"video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:26.153682Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.24477"},"observation_digest":"sha256:5d9608ffd61aea4f47476118b4bfd1b435c5b5df966835c01163bfcee2dd2e6e","observation_id":"14397b1a-ba52-4726-8172-2f7b22fca07f","resolution":{"observed_at":"2026-07-04T16:39:58.305025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.24726","last_updated":"2026-06-23T15:50:33Z","snapshot_observed_at":"2026-08-08T04:12:18.490995Z","submitted_at":"2026-06-23T15:50:33Z","title":"SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T00:16:58.697810Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.24726"},"observation_digest":"sha256:c3da86a15883caa53585bead0f0c467551297003130795912c426c8089d56b48","observation_id":"4a016ead-b161-4f75-9c21-69231b25c231","resolution":{"observed_at":"2026-07-04T16:49:57.207524Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.24797","last_updated":"2026-06-23T16:49:28Z","snapshot_observed_at":"2026-08-09T16:27:20.785450Z","submitted_at":"2026-06-23T16:49:28Z","title":"EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T00:15:02.499635Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.24797"},"observation_digest":"sha256:1b9f1bc6de7bf738fae94a79279ca76d218390ac6d1a9b95fa5f31eaba73ec87","observation_id":"914c7baa-e9a1-4992-99d0-62cdf3a31be1","resolution":{"observed_at":"2026-07-04T16:49:57.436227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.26904","last_updated":"2026-06-25T11:37:51Z","snapshot_observed_at":"2026-08-08T03:59:36.206144Z","submitted_at":"2026-06-25T11:37:51Z","title":"Confidence-Aware Tool Orchestration for Robust Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T05:23:06.035263Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.26904"},"observation_digest":"sha256:61c4efaaead3ba3e84707200e4d710b244ae8d5c5ff1568647e00d579fdd2ca9","observation_id":"30d2d600-87d3-489b-a7f9-dd3126e21177","resolution":{"observed_at":"2026-07-04T13:19:50.412449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:1348498cabbb2c0a9bda8363182f2776de08636633967a094c2c9535c02a6eff","observation_id":"681b6f61-0b12-4792-bef6-8b8f45d5e7e0","resolution":{"observed_at":"2026-06-30T06:34:19.518606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":"2504.06958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-04T16:49:57.434938Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"7be17d59-6cde-455a-99c3-06e28659839f","year":2025},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:de53ab8cda9ab3981ee2f30745c8e28410b4be22b6926886acfc7d4a1648d59f","observation_id":"91b7455a-3319-4643-9018-ee038b7dfbc1","resolution":{"observed_at":"2026-06-30T06:04:21.278200Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-12T05:50:16.895740Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02959","last_updated":"2026-07-03T05:05:59Z","snapshot_observed_at":"2026-08-06T10:42:51.828740Z","submitted_at":"2026-07-03T05:05:59Z","title":"Incentivizing Vision Language Models to Search for Long Video Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T05:50:16.895740Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.02959"},"observation_digest":"sha256:32c7027521aea715fe507d4fd8bf7c1054f412c0a0f27fc1f3d7816505afbc64","observation_id":"00312180-ed44-4d12-944c-208c8c81fd53","resolution":{"observed_at":"2026-07-12T05:50:16.895740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-09T08:34:06.125045Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:c91a75982bd2007cf0d028f9d80ba305c7086f3c78dd3eaf09596cba79faebc0","observation_id":"aee1a0d5-b869-43bb-9627-ed8ab4b7ad00","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-12T05:07:18.364787Z","title":"arXiv preprint arXiv:2504.06958 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03069","last_updated":"2026-07-03T08:03:35Z","snapshot_observed_at":"2026-08-08T00:05:54.404752Z","submitted_at":"2026-07-03T08:03:35Z","title":"SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T05:07:18.364787Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.03069"},"observation_digest":"sha256:2a0dfdc8f095f4b92a59606e25166dcf33cfcf84e3952fca8a15804e400ed1a6","observation_id":"768652a0-16ca-45b3-a088-c0df4cacf6f0","resolution":{"observed_at":"2026-07-12T05:07:18.364787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-07-11T08:59:46.244502Z","title":"arXiv preprint arXiv:2504.06958 (2025) TimeThink: Reasoning with Time for Video LLMs 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05089","last_updated":"2026-07-06T13:50:15Z","snapshot_observed_at":"2026-07-11T08:59:45.751461Z","submitted_at":"2026-07-06T13:50:15Z","title":"TimeThink: Reasoning with Time for Video LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T08:59:46.244502Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.05089"},"observation_digest":"sha256:ccab29e7dc9f70ca74feb11b1fa77e131923e1bb641445013ffc594aa1493606","observation_id":"e262efdc-a516-4bb8-8808-a1c2677d9af5","resolution":{"observed_at":"2026-07-11T08:59:46.244502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-02T00:44:50.850439Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:50.850439Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:6c6b11af443a6d208bb01015489c90f893c24c67b5dab0dcf40cfb73a0b88158","observation_id":"17d442bd-d18f-433d-950b-b6bd4e6db1e1","resolution":{"observed_at":"2026-08-02T00:44:50.850439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-01T21:09:43.463242Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-08T05:22:33.805882Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:43.463242Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:36536a54f3a630c7726ff51f0102c5eb0c694bf56aa88f9ceb73a996e84d56c7","observation_id":"2d96c88b-f6e2-46a0-8165-73e347507928","resolution":{"observed_at":"2026-08-01T21:09:43.463242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.06958/citation-record","integrity":"/paper/2504.06958/integrity","json":"/paper/2504.06958/citation-record.json","paper":"/paper/2504.06958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:8fef574bb145d79fe554fdbbf3cf195693f48c721014702d5abcc49864af93b8","observation_id":"fa300db1-6c7e-4328-b28a-2e9b467ab154","resolution":{"observed_at":"2026-05-15T20:56:07.773391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13441","last_updated":"2024-12-18T02:23:33Z","snapshot_observed_at":"2026-08-11T13:05:21.132344Z","submitted_at":"2024-12-18T02:23:33Z","title":"FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":"2412.13441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13441","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashvtg: Feature layering and adaptive score handling network for video temporal grounding","venue":null,"work_id":"c5f0f767-bf04-40e1-894c-327d95458eb7","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.13441","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:ce4b0c9e916051bc63b4eef372ba4e20b2cc8e042ab2bf3cc60b9c904d3f0490","observation_id":"3be6774c-fefb-404f-8bcc-7cad0151f320","resolution":{"observed_at":"2026-05-15T20:56:07.664542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-07T17:17:34.989308Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.07065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-07-04T15:09:54.970421Z","title":"arXiv preprint arXiv:2503.07065 , year=","venue":null,"work_id":"45c3a58c-d62f-4f0b-84d6-98d7c29563e4","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:6439d61872986916be7667a8828c281f8a5634cec21bcea10de45396080fa531","observation_id":"2c866938-5ec6-4e64-b313-5723a5276481","resolution":{"observed_at":"2026-05-15T20:56:07.673376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":"2503.17352","doi":"10.48550/arxiv.2503.17352","metadata_source":"pith","pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","venue":"cs.CV","work_id":"de4c64e1-82b1-4f70-8311-a3539e7bf400","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:15f76b05622c4ada47333b4425607e868dbcc80d98512eb650af73c5710f262b","observation_id":"8a4e1c4c-5e79-476a-99f5-59a5023b75de","resolution":{"observed_at":"2026-05-19T06:59:03.519833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:c9016f3e2279795570a23ad2cfe563d3384a3cfd1673e6a58cb3b1598f195caa","observation_id":"565583f5-7cc3-4243-877d-b51e82a91195","resolution":{"observed_at":"2026-05-15T20:56:07.684571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:46d58db206416963feaab9030505e2316d64050df1e8d29fedd9591091ca2834","observation_id":"b1ed0ac3-259d-40bb-88a1-bd76ffd01727","resolution":{"observed_at":"2026-05-15T20:56:07.695329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.221351Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"3fff97ee-fb43-4bb7-adf2-e6f22813b5ea","year":2017},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:da838d6f86eac931f920118e90d053e864e7f925b5f371d23c729007c67901e3","observation_id":"04fc8b7a-aa16-4854-b090-bd69702cb522","resolution":{"observed_at":"2026-05-15T20:56:07.888845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.01615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:17:29.102296Z","title":"Saliency-guided detr for moment retrieval and highlight detection","venue":null,"work_id":"ea8aa9d4-cd29-4221-a523-253d41141d10","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:25632baf15d8afb3c681a40fbffcffa49f0aab7a7648dadd1773b369b7d577fe","observation_id":"49cb3267-5edb-4867-b5b5-dc8809246fac","resolution":{"observed_at":"2026-05-15T20:56:07.779989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:64cb2538b5f7beb049f1ff58800b249c5cf2f19a81b5ff8a18b1a44c28251ec1","observation_id":"0949eb1c-3dcc-4606-8923-aed3099d416c","resolution":{"observed_at":"2026-05-15T20:56:07.786208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild.IEEE transactions on pattern analysis and machine intelligence, 43(5): 1562–1577","venue":null,"work_id":"5c431fb8-7f9f-4e1d-8b87-e0cc9c6c9849","year":2019},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:f1ff7f6a0c7ac65990538517b607b399a3f3f4c1d8a89cd1d10c60499cdd1305","observation_id":"6ace0399-f7f9-47d5-8d00-07ca26340e47","resolution":{"observed_at":"2026-05-15T20:56:07.901787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-11T01:33:05.827241Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"cited_work":{"arxiv_id":"2501.00584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00584","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Video Under- standing: A Comprehensive Benchmark and Memory- Augmented Method","venue":null,"work_id":"dfb93eca-d643-48fe-befe-016a665764e2","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.00584","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:11e64b8f2cfecf38e7811ea09f0bb7dd632ec1aed795ba6165cc5af3ddd8bd41","observation_id":"8c402674-59cd-4bb8-8c71-e557319a38ff","resolution":{"observed_at":"2026-05-15T20:56:07.794133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:bb255061a2058048cde0272e34a5dc9cc942d580dc9ee001cb63a9480d0eeca3","observation_id":"4b2d7e38-b69b-412e-852b-4cdb9c56169f","resolution":{"observed_at":"2026-05-15T20:56:07.800834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"11103d75-984c-4dd2-a0ce-0b6b5e0f3554","year":2017},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:759d0f9d278ee0c1f825bcd11ede472c92d17b5f0f8edb268ead6140f96bbe81","observation_id":"7365848c-3171-4ddf-af3c-d18e296cf342","resolution":{"observed_at":"2026-05-15T20:56:07.917926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:3f25c834a8f1e3aaf3958b40bafd0b7cdc55f73d2483bf661fecf1bd651557fc","observation_id":"660889a1-6a46-4982-a916-8f1ef2e247ea","resolution":{"observed_at":"2026-05-15T20:56:07.809487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T22:40:10.912714Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"29bef5f1-e6a4-4e87-8fbe-118e1444be6f","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:25185574d27ec5d8bffbebd5238a146bc9c5b4fd0417daf917f031f5d1564ead","observation_id":"38592194-23db-41de-bebe-606b597e70fa","resolution":{"observed_at":"2026-05-15T20:56:07.926756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06491","last_updated":"2024-07-09T01:49:08Z","snapshot_observed_at":"2026-07-06T18:43:26.425575Z","submitted_at":"2024-07-09T01:49:08Z","title":"VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model","version":1},"cited_work":{"arxiv_id":"2407.06491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06491","snapshot_observed_at":"2026-07-02T02:56:28.983694Z","title":"Videoeval: Comprehensive benchmark suite for low-cost evaluation of video foundation model","venue":null,"work_id":"83710f5a-a678-46ba-94fa-1ae76afbd51e","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2407.06491","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:3fa6d05df3636047a90355350de57dad974ae8c9db9d1b5b004cf5ac896d35eb","observation_id":"d74d232f-e4f9-40be-b7c5-f9d0342000ba","resolution":{"observed_at":"2026-05-15T20:56:07.815156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":"2501.00574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-07-04T16:49:57.265026Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","venue":"cs.CV","work_id":"52ec7cb6-1ef6-4366-a43f-d4c13fce23ad","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:49d2c1445fd3f307c9a40b9d96f1c6466176caf26dda01e358801479481a3a65","observation_id":"304f2a4f-3440-41b9-a78a-5c5e63b912ff","resolution":{"observed_at":"2026-05-18T04:02:43.915683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":"2503.06520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-07-04T19:30:08.050016Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","venue":"cs.CV","work_id":"7a33b2a4-8409-4a00-ad7b-84e810df1ba7","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:cdb1871c55bd149622ff6d0c235c6ea2126dcdd086b2ee1914c817c2c47bc3d1","observation_id":"b1f451b9-5f8d-4ee7-9797-66ffb66a0549","resolution":{"observed_at":"2026-05-16T12:31:43.641168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:90ce8b16af9382a27070428029aa40bf9c4076f08ba6b292419c8d9243fa926d","observation_id":"ec234bcd-674c-4608-888f-c610fe3f33f1","resolution":{"observed_at":"2026-05-15T20:56:07.836042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:7651229d055af11a91da8760758dd8a61f4345de18317181d268c6c9bad259f7","observation_id":"f5ee1669-04c0-4714-a61c-7722cfde4a38","resolution":{"observed_at":"2026-05-15T20:56:07.844768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36: 42748–42761","venue":null,"work_id":"6929ee98-adb4-4102-a06a-d72e20f93850","year":2023},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:38ea012405d9ceeb87d5c0915e672b6e3e89ac33dbe334af786bb14cec9ba7ad","observation_id":"552140d7-f2db-42cc-b8c9-085333b56e8d","resolution":{"observed_at":"2026-05-15T20:56:07.922359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":"2503.07536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-07-04T10:39:45.355868Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","venue":"cs.CL","work_id":"30c18d3e-432d-404b-9572-1c7375bee8ed","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:57873ea9f42bda6c1a56064805b5dbbf3da9bd41c8fc1e961847913435f09fd9","observation_id":"60953261-4d9c-40fd-a447-9f79c74b7298","resolution":{"observed_at":"2026-05-16T15:15:46.589538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:d0497e9c154f087478c65756adff31417b89cbec96b0e7fe9ae519432a9e8a1a","observation_id":"829f1d38-6a9c-4983-ac44-fafe008a183c","resolution":{"observed_at":"2026-05-15T20:56:07.856503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:9c1add64e14e06795a29296ceed98f9c1c6c1f81ec4ed326971337d14cf09fcc","observation_id":"c409a1c8-e932-48b3-aa22-b95800169138","resolution":{"observed_at":"2026-05-15T20:56:07.862745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:3dd6c10131069849ebb1029503cf9e6ae3f9f52bb531521a6df481958c35fc0f","observation_id":"1ba35c61-2595-4c3e-81cc-798898ead23d","resolution":{"observed_at":"2026-05-15T20:56:07.869285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:eababa9ddafb8ec62f3dda95a4378d11c6d51b44d3316983f0310a6f55998da4","observation_id":"2887b8fb-5f10-4006-aa6c-aac2821363c2","resolution":{"observed_at":"2026-05-15T20:56:07.874721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:accc8dbfadfb5c9dd2ef6ef50607bce4fd1cab7e2bb6a3c0941dbe75e01322c1","observation_id":"8470cac6-2907-4aee-90c7-e6e76052aa6a","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"9384bdef-ef5f-49dd-9a4f-cd3148698d52","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:4d9fab15978bb4221b2bf4022091a348cfb35370b7614cb09ad01455f2ddac27","observation_id":"08e619e6-26c9-4e84-aa76-f1dfd6212508","resolution":{"observed_at":"2026-05-15T20:56:07.893482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":"2501.12386","doi":"10.48550/arxiv.2501.12386","metadata_source":"pith","pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","venue":"cs.CV","work_id":"5801b83f-d5f4-4020-bad2-4bc47f71fe7d","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:7120769de62b77e256e3fde5f39d40671f3b5d84efd5200308a274575d075d44","observation_id":"a0ccc2c1-0ac2-406c-8c64-f23499a54bad","resolution":{"observed_at":"2026-05-17T02:52:20.835573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37: 28828–28857","venue":null,"work_id":"149c891d-279b-412e-887e-07b7ff27343b","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:bc9e0e1e5cd5a3b8cb024ce92ba2ac7b817bcad6f209771eb6ab7fc951357ae5","observation_id":"bd8ec7a5-ec15-40f6-b610-69e30b6d4c39","resolution":{"observed_at":"2026-05-15T20:56:07.907161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.217854Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"720fff4e-cbde-48df-91c5-f76e3372e440","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:a5c2a1a2b1311ccb3ebc21413cf393c2275ffa7340f3d68a189393080a8249b0","observation_id":"04a206cf-250a-48e2-ae51-bf2eb5a759b9","resolution":{"observed_at":"2026-05-15T20:56:07.912757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-08-10T22:46:57.431139Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"cited_work":{"arxiv_id":"2501.00513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00513","snapshot_observed_at":"2026-07-03T00:17:28.977461Z","title":"Fine-grained video-text retrieval: A new benchmark and method","venue":null,"work_id":"39915ff3-b10b-4d5f-a0bb-4e9c5b51b67e","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2501.00513","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:52a839d28c34a898aba6279b10346e61c0b8758599fcf924689906f4b0c8b903","observation_id":"262fe47c-c479-434d-ad18-cf9fbb39a787","resolution":{"observed_at":"2026-05-15T20:56:07.717041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T00:39:56.306346Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"cited_work":{"arxiv_id":"2412.19326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19326","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task preference optimization: Improving multimodal large language models with vision task alignment","venue":null,"work_id":"90adeb70-7a41-48c6-8e9e-e8346533501e","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.19326","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:73f56b9d6e248477ab4d34b74df16a87469dfaa4c0ecd4f9092c231d61d0e761","observation_id":"38640935-a25c-466a-b623-b70ebbdb310d","resolution":{"observed_at":"2026-05-15T20:56:07.724355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:53394b726aea0401f91cda047aae63b3fcb71afc7f5231ce226215521c548fdb","observation_id":"e3e3247f-29a4-4ae2-a1fb-2f6d60552615","resolution":{"observed_at":"2026-05-15T20:56:07.729810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":"2503.10615","doi":"10.48550/arxiv.2503.10615","metadata_source":"pith","pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","venue":"cs.CV","work_id":"bd2bf4d0-20bf-49b8-8dac-b54a8019be6c","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:fd5010edd8612527aee96b89a538c5687ab9124ebda55efb9aff13f0ca4b7e36","observation_id":"ab973397-268d-4593-8393-2e207b42a010","resolution":{"observed_at":"2026-05-16T00:19:20.780377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlin: Empowering multimodal llms with foresight minds","venue":null,"work_id":"71d2cbf7-9249-4c0a-a979-f38be2516ea0","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:c4e4031c770b1816f7a2d2137757f1dae2358afeacfe8d681d66059ed8fafbeb","observation_id":"4eb0ca53-8467-4220-afe8-7fa34cd6c1a5","resolution":{"observed_at":"2026-05-15T20:56:07.930594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19702","last_updated":"2025-02-12T16:47:30Z","snapshot_observed_at":"2026-08-06T08:21:30.398010Z","submitted_at":"2024-10-25T17:19:55Z","title":"TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning","version":2},"cited_work":{"arxiv_id":"2410.19702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.19702","snapshot_observed_at":"2026-07-02T12:16:57.715387Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":"f2ca8961-3931-4220-a78a-7f084312f7b0","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2410.19702","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:16883e8e63ef569f9110c44f0a1bf27a964a3ade29a2ca45a37cf785837d9998","observation_id":"159f87b7-00c8-4b9a-ac7a-9274e28fa6f9","resolution":{"observed_at":"2026-05-15T20:56:07.743281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-10T11:40:54.338233Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.18013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-07-04T15:09:54.981702Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":"ccaa00a7-887a-46c8-8ddd-9a3264fe2453","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:8474d2f58cab56b842e6a5a10516ce3337a3b5ec677e6d7ee5b5b1852c13f5aa","observation_id":"dd411d1f-0a5f-44d6-b5df-ac076a45f325","resolution":{"observed_at":"2026-05-15T20:56:07.750683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:8b330ad5e1a7b4d43e28a4669a233e6aab8ef745ebbf0687903d3a11a26d23cc","observation_id":"b1cca0fc-c2a3-455a-86fd-09981ad80142","resolution":{"observed_at":"2026-05-16T15:04:22.925544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:19ebebd2e2c96ad2665d51dd67287122aceba284c0616c95f314724e87f4c3f4","observation_id":"3caa9af6-8bcb-4af9-a24a-5ae85ccc00ba","resolution":{"observed_at":"2026-05-15T20:56:07.764632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning.arXiv e-prints, pages arXiv–2503","venue":null,"work_id":"d7f970e6-bddd-4fbc-9a27-3f41c441296a","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:87dbab5a3066af1277b4473a7ace3701ecab1043cf1a44a0892cb072a4396aaa","observation_id":"01cb1b88-b7a3-439c-8d34-65dd1858338a","resolution":{"observed_at":"2026-05-15T20:56:07.897597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-11T02:58:52.773885Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":"2503.05132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-07-03T20:48:56.122150Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","venue":"cs.AI","work_id":"6f1085b5-ac9c-45c9-8277-b11a779f1cba","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:6d550f0f22d1288fe94337c1c3eb61e167f0f3bd0f162e3bd93fa0e529ae2cf1","observation_id":"bbcc9512-14cb-4621-bf6e-37c7f8efb5be","resolution":{"observed_at":"2026-05-19T07:13:47.672124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":32,"verified_fuzzy":10},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 100 inbound Pith citation observations for arXiv:2504.06958."}