{"as_of":"2026-08-08T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d51f668b1c8de77a16fc3c627a515efc6714d94d06b7339279ae560ff9dabe40","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:48.103145Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:03:29.800596Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.219030Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-08-06T00:03:29.800596Z","title":"Reinforcement learning tun- ing for videollms: Reward design and data efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:29.800596Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:53a59cb4605aa9e640c203e65bb7606ead62b8fe0327f5bf741f2e31a4d583e9","observation_id":"c2f4e65e-d940-42b8-8d43-1f68641fb498","resolution":{"observed_at":"2026-08-06T00:03:29.800596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-08-05T22:01:25.936958Z","title":"arXiv preprint arXiv:2506.01908 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:25.936958Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2508.07683"},"observation_digest":"sha256:ab50ce7b53ef20ddec27d94e48a755b5d65153f85d7f1b9efdf9e0a70a3f506c","observation_id":"9ab09eb4-570a-404a-9b79-903c34a99536","resolution":{"observed_at":"2026-08-05T22:01:25.936958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:c3e9503ca868e377c8954f7564942711118f3790b57a9a12cfef83fdf718b590","observation_id":"050345ff-e308-45d7-9f82-44827a2917c7","resolution":{"observed_at":"2026-05-17T02:11:26.630505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:a5c52e9e0953b1f0922d398267d017ff71a601b91548568ea2e6f1f4a39c5371","observation_id":"5d6fde9d-8de0-49ff-b154-7fd71dcbe877","resolution":{"observed_at":"2026-05-16T21:28:34.346222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:8f7d8e098d70ddd051a59261e3bd11b7bf7a53e47c7e693d39dbc4dd89c517e2","observation_id":"d62ebeaa-5f0d-4f4c-bb7e-d320650c0026","resolution":{"observed_at":"2026-05-15T20:50:17.320193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2605.26680","last_updated":"2026-05-26T08:16:16Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:16:16Z","title":"DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T17:50:00.740770Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2605.26680"},"observation_digest":"sha256:0af36495f7c14a86db9409b0d12bec3d781eb42a3f0ca8da5cff10a32c837b3f","observation_id":"5f329e02-4e84-42af-94a8-3b9914d312ba","resolution":{"observed_at":"2026-06-29T17:53:47.135590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.09248","last_updated":"2026-06-08T09:21:01Z","snapshot_observed_at":"2026-07-06T23:48:39.574979Z","submitted_at":"2026-06-08T09:21:01Z","title":"Temporal-Aware Reasoning Optimization for Video Temporal Grounding","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-27T17:21:30.638275Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.09248"},"observation_digest":"sha256:e086e5450c8c81a11d9f8dc1f350012ef39c53b2a139643e986cb52ed36ea735","observation_id":"2673ee9c-ee9e-4103-a9ff-3e0560d47143","resolution":{"observed_at":"2026-07-03T00:17:29.087471Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.18441","last_updated":"2026-06-16T19:42:54Z","snapshot_observed_at":"2026-08-03T17:38:18.858871Z","submitted_at":"2026-06-16T19:42:54Z","title":"Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:02:37.632461Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.18441"},"observation_digest":"sha256:113c470f8d7ffff4d845d18ecd70a087b57f0e5d2e756829d240c6476a320967","observation_id":"78b1981f-1631-4e84-8e43-db819365475a","resolution":{"observed_at":"2026-07-03T20:58:57.749200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.19927","last_updated":"2026-06-18T08:28:26Z","snapshot_observed_at":"2026-08-04T14:48:49.353979Z","submitted_at":"2026-06-18T08:28:26Z","title":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:34.203135Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.19927"},"observation_digest":"sha256:0710a80e7d229fbac175674c8acd7f26414278161a1b27789ca1a493975e94c9","observation_id":"5fe7afff-ff8f-4d04-bc81-d73212b62804","resolution":{"observed_at":"2026-07-04T03:29:31.391135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.24107","last_updated":"2026-07-03T09:17:12Z","snapshot_observed_at":"2026-08-01T13:42:02.404759Z","submitted_at":"2026-06-23T03:50:28Z","title":"DramaDirector: Geometry-Guided Short Drama Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T01:57:15.550335Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.24107"},"observation_digest":"sha256:c7adf4a92321979ed4be16063bb6d4d8955be2951617f542c57c2625bc603e93","observation_id":"17baca14-be29-4760-8abd-79b8b54c4837","resolution":{"observed_at":"2026-07-04T14:59:55.979608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.24726","last_updated":"2026-06-23T15:50:33Z","snapshot_observed_at":"2026-08-08T04:12:18.490995Z","submitted_at":"2026-06-23T15:50:33Z","title":"SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T00:16:58.697810Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.24726"},"observation_digest":"sha256:645e559b253b43326591e060814b5040ff3569fe6102b9fa57ccc38054f46afd","observation_id":"c728d01b-29e6-4990-bdbd-fdb58bd8a711","resolution":{"observed_at":"2026-07-04T16:49:57.220535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":"2506.01908","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-07-04T16:49:57.219030Z","title":"Reinforcement learning tuning for videollms: Reward design and data efficiency","venue":null,"work_id":"058b4756-2b75-4b6d-aa11-ba523aab08e0","year":2025},"citing_paper":{"arxiv_id":"2606.27828","last_updated":"2026-06-26T08:12:04Z","snapshot_observed_at":"2026-08-06T13:58:57.000121Z","submitted_at":"2026-06-26T08:12:04Z","title":"Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T04:53:25.259840Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2606.27828"},"observation_digest":"sha256:6d0bc6683715fc82cbde263021834ec94b2e3cb5f39fd8314aa3db66cf08b768","observation_id":"2ba040e6-b12e-4f6b-a703-ede10224c1a3","resolution":{"observed_at":"2026-06-29T19:13:52.951272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-08-01T18:04:13.530716Z","title":"Re- inforcement learning tuning for videollms: Reward design and data efficiency.arXiv preprint arXiv:2506.01908, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:13.530716Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:15f09b81b04839ce4ae2bb76823195cb80a77fdb6d81cf617265dee9737c2fc8","observation_id":"2c46cb5e-b4d1-46c7-a68f-ac8bc4892e0c","resolution":{"observed_at":"2026-08-01T18:04:13.530716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01908","snapshot_observed_at":"2026-08-04T17:24:14.453570Z","title":"Reinforcement Learning Tuning for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01980","last_updated":"2026-08-03T09:42:42Z","snapshot_observed_at":"2026-08-07T07:07:29.682368Z","submitted_at":"2026-08-03T09:42:42Z","title":"AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T17:24:14.453570Z"},"links":{"cited_paper":"/paper/2506.01908","citing_paper":"/paper/2608.01980"},"observation_digest":"sha256:2524239871fcc7e9d43fd75a574eed8af7de0f6beee01abf36585385b3fca8ec","observation_id":"1ed0b2c7-1ed2-42c3-be13-e58a000da904","resolution":{"observed_at":"2026-08-04T17:24:14.453570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01908/citation-record","integrity":"/paper/2506.01908/integrity","json":"/paper/2506.01908/citation-record.json","paper":"/paper/2506.01908"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.652453Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:44.652453Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:90ec737d71abec64f8f48485468c559b820f052446803955e818eb161eaaacbf","observation_id":"3e2ed415-a459-42f9-a09f-d03a53b8e48a","resolution":{"observed_at":"2026-08-07T11:35:44.652453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:35:44.713622Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:44.713622Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:82d7c26c7c28d3ec8c96468eb1bdf4f6a7c18a4486c37d3ce699e92360154be5","observation_id":"5e6a877c-0211-4de8-ac75-94c96c2d6796","resolution":{"observed_at":"2026-08-07T11:35:44.713622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T11:35:44.824339Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:44.824339Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:0fefab4c6b34a9620a2727be2466aae9c5d9b061fb7a8c335c6c2cc569d78f37","observation_id":"eccda8be-c02a-419c-b524-25ba3ae25d04","resolution":{"observed_at":"2026-08-07T11:35:44.824339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T11:35:44.928073Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:44.928073Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:a95986f34e1a3bf1bb191a74ed68b01bf5fb4cfba3bb072f0b3edf1f247d22ba","observation_id":"8fc8c328-42a3-459d-8d07-088e5c15919c","resolution":{"observed_at":"2026-08-07T11:35:44.928073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:35:45.014401Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.014401Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:7108d285ee19b82442d14668581e9d4d660cf251856b250484f7addf5461b78c","observation_id":"8569e3b4-44da-4cba-a19a-2d97d92b075c","resolution":{"observed_at":"2026-08-07T11:35:45.014401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.104221Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.104221Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:3ccdfd205231fe84d95857a865a8363a5171856d588ea5447008c887f6a85389","observation_id":"45f9f087-ac3c-4db6-88b4-1b9f4814e1cb","resolution":{"observed_at":"2026-08-07T11:35:45.104221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:35:45.203654Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.203654Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:3168d1da3320012a44afb452f4af26c33057fa0b2d62a6aff8e5d2b1132ba11d","observation_id":"df619bf6-970c-49cf-b621-4114a27adc8b","resolution":{"observed_at":"2026-08-07T11:35:45.203654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:49.542254Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":"4af3b357-b9f8-4ed7-894a-dcf95cb23b9d","year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.285208Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:59d9276a95af2dfc3084b5e41aa6e09a8d3ee73c24ac95c5df3309bb8cde08b2","observation_id":"d07b57b7-0ada-4364-a2cb-8ef7e1fd7278","resolution":{"observed_at":"2026-08-07T11:35:49.620578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-08-07T11:35:45.372866Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection.arXiv preprint arXiv:2411.14794, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.372866Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:fbd2a9130e91c809de457e7bcc44df7d6edd662b353bd4220f111566cedbc9c9","observation_id":"2771756b-e8fa-4632-881e-95c545e86d39","resolution":{"observed_at":"2026-08-07T11:35:45.372866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.455429Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.455429Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:e83b7442077edf801f867f13e85eb3155831610f19d2cd21fc2515d97e50c3d1","observation_id":"9da80ad0-f63a-4bc9-a3db-7b3d1e21690c","resolution":{"observed_at":"2026-08-07T11:35:45.455429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.552030Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.552030Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:dba6eb4f672179abdee35dad5ab91fc665e0aa5fc7905fa618d629f7faad1509","observation_id":"43b7121e-3cac-4838-88fd-b8361a7a9dc0","resolution":{"observed_at":"2026-08-07T11:35:45.552030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:49.338469Z","title":"Unleashing the temporal-spatial reasoning capacity of gpt for training-free audio and language referenced video object segmentation","venue":null,"work_id":"45cae749-89e0-492d-a327-85ad7f1c36a5","year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.640676Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:9e509a08ef251a62824ef45d3cf21d62792de7a3b5cdde5bfd50edaa5ee9fba4","observation_id":"45cfdbd5-8265-4231-a9f7-f3e8f5fd40f1","resolution":{"observed_at":"2026-08-07T11:35:49.420703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.715578Z","title":"Dense- captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.715578Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:19e83bdbce1be12f8fbcf4c49e94065213f0f595aa763ade3d88134f798b67cc","observation_id":"3d982fbe-eb3f-4b05-8f52-62c741a52b0c","resolution":{"observed_at":"2026-08-07T11:35:45.715578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:35:45.796764Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.796764Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:cc318b73cb8b76bb549f80fc4392183dcffad3e1ee844784659eaafac3fc8a96","observation_id":"4a6e2bcb-30ea-4ec2-9188-066139becf08","resolution":{"observed_at":"2026-08-07T11:35:45.796764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-07T11:35:45.865632Z","title":"Llava-st: A multimodal large language model for fine-grained spatial-temporal understanding.arXiv preprint arXiv:2501.08282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.865632Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:ada416a27cd5b516f1eab4d7068e51c5cb20522502991023c177d77238261d35","observation_id":"f79c5a1c-78e4-4915-8011-72b2ac8f5279","resolution":{"observed_at":"2026-08-07T11:35:45.865632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T11:35:45.945951Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:45.945951Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:42d4e8f4ac176aa070c88a804ec363defb185b5847e517e3fbc1f8b51fa712c3","observation_id":"f4f70289-08d2-46c8-ae70-8bcb2c2b402d","resolution":{"observed_at":"2026-08-07T11:35:45.945951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.014402Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.014402Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:21f2f47e9f547c628f141b20cf64fb2246b88298b69cc003e7191451f4422882","observation_id":"ea610f96-09fd-40b8-9665-c8b5486b81d1","resolution":{"observed_at":"2026-08-07T11:35:46.014402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.091779Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.091779Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:4c15f706e0a8c16b8212e4cfd81d7fc97eff8c156ea7d0f300bed8cc61aac065","observation_id":"4a53e36c-eb1c-4e6f-8fb3-3e6f8f8694de","resolution":{"observed_at":"2026-08-07T11:35:46.091779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T11:35:46.174675Z","title":"Kangaroo: A powerful video-language model supporting long-context video input.arXiv preprint arXiv:2408.15542, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.174675Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:b135e5e709fef7aba66033c15c0f55252106d1abc47e6cd372daccc041d846de","observation_id":"c7ba70d3-efd9-41c4-bb52-345f72de1a67","resolution":{"observed_at":"2026-08-07T11:35:46.174675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.261016Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.261016Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:cd8ba6445fc6ddd8383183d7b41db7c82b3d855be150ab6c3fe4005b79332fde","observation_id":"79e47c18-6a64-4be8-92c6-176f2ac99756","resolution":{"observed_at":"2026-08-07T11:35:46.261016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T11:35:46.327864Z","title":"Tempcompass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.327864Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:db5c55432fd52168ab42801a9c9b38a2061031a9660a5c0fe1da244beb5a3375","observation_id":"56dba7d3-10b7-4430-87a0-afb694e0234a","resolution":{"observed_at":"2026-08-07T11:35:46.327864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:35:46.421128Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.421128Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:b556bcdea7cf62e25387bb1bb842cd40227ec72b1dd4a8fe6630be88eceeadc4","observation_id":"123f7ac3-f57a-4fee-8903-251e01aa0edd","resolution":{"observed_at":"2026-08-07T11:35:46.421128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.515892Z","title":"Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36:42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.515892Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:c26c8c710e30c2f81512b37e82e9e5930192bfd18f0399a00c0686cc58da54a6","observation_id":"573628b1-4839-4208-820e-ad9f759dbedb","resolution":{"observed_at":"2026-08-07T11:35:46.515892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-07T11:35:46.597000Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning.arXiv preprint arXiv:2402.11435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.597000Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:7bca584979146b7d3f7ef759b848a55d099b3344322060ed7091a59063911484","observation_id":"a10982dd-14f0-48e5-a377-08aea53acc44","resolution":{"observed_at":"2026-08-07T11:35:46.597000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.692867Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.692867Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:6a3adbac23fcfa11504d1bdd80c8f6c413127e4c828cc4947abe409b948c5e9c","observation_id":"2e07006d-1dbc-4672-bfbc-14f921321bc9","resolution":{"observed_at":"2026-08-07T11:35:46.692867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:35:46.785592Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.785592Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:d68a2fefc2f9e5af6b0da53be998ac6521a5d3157d0d8c37f376d645e676a0d0","observation_id":"886ba38e-c3c1-4fe8-ae62-1a6c3912c6d6","resolution":{"observed_at":"2026-08-07T11:35:46.785592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T11:35:46.872216Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.872216Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:1f5187955c62c31daab3e9e125ad59ecc00f9f38e8616e78eee1420a223bdaae","observation_id":"dc1fead3-176b-4331-8547-5c910e8d96d6","resolution":{"observed_at":"2026-08-07T11:35:46.872216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:35:46.943484Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.943484Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:9d3c9ef2bcad8acd20a207db4224a2d67429d72b6316da44e3f8748034d394c3","observation_id":"ac4dc91a-c40b-4533-9d0e-c72615597896","resolution":{"observed_at":"2026-08-07T11:35:46.943484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-07T11:35:47.027169Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models.arXiv preprint arXiv:2410.03290, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.027169Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:4c38d5938350391dc7ba7beba5fec17ff688b95c82413e7929b4fbedf53d68a7","observation_id":"921a662e-7183-44a5-b656-983f70e2ff53","resolution":{"observed_at":"2026-08-07T11:35:47.027169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T11:35:47.149960Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.149960Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:b7c23b15934186ec666a6cc9dfe8a99300895ecdb1c8a4446ac1533515722083","observation_id":"c8498e34-385e-46d5-b571-f9cbbe09859c","resolution":{"observed_at":"2026-08-07T11:35:47.149960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-07T11:35:47.240790Z","title":"Hawkeye: Training video-text llms for grounding text in videos.arXiv preprint arXiv:2403.10228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.240790Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:e96ec9593b4b8de8a6d30d5b711ae325c9ed90e22cb1fc571b71a0663d7ecfd4","observation_id":"85ce6aae-bad9-42a4-9987-1de562e8821c","resolution":{"observed_at":"2026-08-07T11:35:47.240790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:47.308312Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.308312Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:225fe8f806738be3e01f62583b6bf1fc778c75ec150e92147c5a2be0d2eff512","observation_id":"e97de0ce-7f61-4652-b68c-917365ddae96","resolution":{"observed_at":"2026-08-07T11:35:47.308312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:47.389258Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.389258Z"},"links":{"citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:14dbb5634ee4002d7515fc180eb2daf69fb5652332e23b000414c56281acea60","observation_id":"295dcf46-87a4-4baf-b49c-c5725e07db3d","resolution":{"observed_at":"2026-08-07T11:35:47.389258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T11:35:47.480823Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models.arXiv preprint arXiv:2408.04840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.480823Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:708fb761d7b6550c9aedd8726d8e919876ed29e9cdb4ff4fabe62c294dd48491","observation_id":"0bb155bc-f509-48e6-9723-679ee5d23c62","resolution":{"observed_at":"2026-08-07T11:35:47.480823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-07T18:11:33.842031Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-07T11:35:47.573465Z","title":"Unhackable temporal rewarding for scalable video mllms.arXiv preprint arXiv:2502.12081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.573465Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:045fcef12c359ab116f2c2af12738bc846e3beebded028b5f1219d7efa401509","observation_id":"8493c7c0-257f-4882-ae9a-c2fa44dea18b","resolution":{"observed_at":"2026-08-07T11:35:47.573465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19702","last_updated":"2025-02-12T16:47:30Z","snapshot_observed_at":"2026-08-06T08:21:30.398010Z","submitted_at":"2024-10-25T17:19:55Z","title":"TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19702","snapshot_observed_at":"2026-08-07T11:35:47.666720Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning.arXiv preprint arXiv:2410.19702, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.666720Z"},"links":{"cited_paper":"/paper/2410.19702","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:8dcdfbcf158f50a847c9a47bc99190ea671e87f6bc6d996d1ce2208012690646","observation_id":"997cf40a-d098-4e74-9803-f8343e4597cb","resolution":{"observed_at":"2026-08-07T11:35:47.666720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T11:35:47.736748Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning.arXiv preprint arXiv:2503.18013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.736748Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:5868f8b01ed90c7068aa622502c5c54c74f4d6504344d60687d5b74e37730f73","observation_id":"b6525d68-4675-45d3-ad5f-a6f602a39e3a","resolution":{"observed_at":"2026-08-07T11:35:47.736748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T11:35:47.821566Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.821566Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:99931753fbe0dcf795cce6cab975236dec5a22e82f527164d5cd84b1199b2065","observation_id":"03c4b6b9-57e9-42a5-ae6d-9513ed906ae0","resolution":{"observed_at":"2026-08-07T11:35:47.821566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:35:47.916580Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.916580Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:04a7e050c4db2db9133ed70b7f4bc281507203272564d344a28b4c265077d6a6","observation_id":"cc55fd6e-4219-447b-b325-f6fe6f62535c","resolution":{"observed_at":"2026-08-07T11:35:47.916580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T11:35:48.023662Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding.arXiv preprint arXiv:2501.12380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:48.023662Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:bc3367ac494601ee279f7d964e0fa81c9feabcd8c772b84a5df598f9ca8e9083","observation_id":"81a57794-523a-4f6d-aa33-8a70e34563d8","resolution":{"observed_at":"2026-08-07T11:35:48.023662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T11:35:48.103145Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:48.103145Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:160e05d03d0fa9e05433b8437ecc863fecce172e958b6bc0022d65b952ac3a3b","observation_id":"68083eb2-8d87-452c-9426-e39db36d209f","resolution":{"observed_at":"2026-08-07T11:35:48.103145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 14 inbound Pith citation observations for arXiv:2506.01908."}