{"as_of":"2026-08-12T20:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90ffecc9750e9b5502a71f0584a742256f23d098d8765474f859e55132b72bd1","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T02:40:06.454859Z","state":"measured"},{"denominator":154,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":154,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":67,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:13:44.215349Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T09:49:44.696023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":294,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:47704124dfd56809e54a86abbcbf8d9179c5e22ff3e0677945b9d8c33a3b2668","observation_id":"9df5ebc1-7b43-423b-8179-047756f94512","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:b3d90f5ba6e35dc8fef916456a23afd50ad9cf6e1ade450caa9ea6dab4bd1b73","observation_id":"8470cac6-2907-4aee-90c7-e6e76052aa6a","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T14:31:18.006760Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:18.006760Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4efe3346b4afd8a28d79e3a2d74036cd8de98a4e5bbdd58d10c7e85e988a3b7e","observation_id":"d6cae0dc-e243-4e0e-a681-2f9ff39a6224","resolution":{"observed_at":"2026-08-07T14:31:18.006760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T14:09:13.173718Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.173718Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:11c533065e97defd626bfb0b13b18fa556e2424b0aba139d9a8416b68589226b","observation_id":"e45504bb-270e-4351-b01d-cf44a4d26041","resolution":{"observed_at":"2026-08-07T14:09:13.173718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:01ebc65d5d7410ccfe41664b72f6d22f63dc18c751f8ac3660db2c9c083bb8e4","observation_id":"4738e270-1e50-44f5-8425-a2d3eae29a93","resolution":{"observed_at":"2026-05-19T13:17:18.579232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:a89d1336f8336bbd2d7298bbb332edd97cec0180afdad2e1c9bc1f654877af82","observation_id":"567138e8-a2ed-4853-a95f-46264c02480d","resolution":{"observed_at":"2026-05-17T05:40:56.053231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T11:40:36.023507Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.023507Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:c43a089a78f93597ddd213d2f556d29a2411f86eedbd3ea5a2f53282d1b7b50d","observation_id":"c1befbf9-e216-4ae7-bb19-6a771e49d146","resolution":{"observed_at":"2026-08-07T11:40:36.023507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T11:04:14.234976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.234976Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:e791e64ffd7623908d4dca74d5d22c8cc661b61a19170b289c3536cdbd56ba07","observation_id":"12058bba-b8d3-4e0e-bbc5-eab30b9b953e","resolution":{"observed_at":"2026-08-07T11:04:14.234976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T10:41:50.420151Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05433","last_updated":"2025-06-05T09:13:37Z","snapshot_observed_at":"2026-08-11T00:38:12.716708Z","submitted_at":"2025-06-05T09:13:37Z","title":"Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:50.420151Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.05433"},"observation_digest":"sha256:ef3f206ff0908470bd981aef481b475e13d23088937085e88abdbe30e8060baf","observation_id":"a6c5df9a-3d2a-4ad6-bcb9-dd537cb0aaaa","resolution":{"observed_at":"2026-08-07T10:41:50.420151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T23:34:53.624919Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-10T21:22:23.494902Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.624919Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:67dd41a841b747a8964bd5d7130fdda858f3cf5524b7ae12e746199a87dcc6e1","observation_id":"78530adf-24b4-4652-b6b5-b232e77c5410","resolution":{"observed_at":"2026-08-06T23:34:53.624919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-08-08T09:01:59.914584Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:3c7596aa9b77f063735432b90205168099d267ff353bac86349ea475a09dc0a8","observation_id":"6db7d921-f0b6-4b81-9228-fda0ec850c77","resolution":{"observed_at":"2026-05-19T06:52:08.036603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T19:47:52.737642Z","title":"arXiv:2503.13377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-11T03:57:37.664844Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.737642Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:9f6a01908e5d03a7303371a1cad29a42756539d864d7225409a766f5f6108233","observation_id":"181b8286-f0e3-43cf-8069-371c4827b030","resolution":{"observed_at":"2026-08-06T19:47:52.737642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T15:25:03.137410Z","title":"Time-R1: Post- Training Large Vision Language Model for Temporal Video Grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-11T01:02:26.046197Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.137410Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:1dfe200fa55e277cb3e812dd2a8536da9ade113a3d02f10e855e85c41c160a39","observation_id":"cb440322-a61d-4a06-8915-060afcbbc754","resolution":{"observed_at":"2026-08-06T15:25:03.137410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T14:44:28.039862Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.039862Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:b0e7652e2c966c74499363f6e64eadbe4881e5953040df0714b8f6e3c443a0af","observation_id":"67e962c9-f402-42cc-accd-73d4f0f5d21b","resolution":{"observed_at":"2026-08-06T14:44:28.039862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T00:03:33.307499Z","title":"Time-r1: Post-training large vision lan- guage model for temporal video grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:33.307499Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:6a804d982855d50e7aedc7814126cada0df5930ad75e10a8dbdaab1b420aab20","observation_id":"9add315c-0754-41b9-ba02-1dd5eb712c19","resolution":{"observed_at":"2026-08-06T00:03:33.307499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-05T22:54:32.447112Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06317","last_updated":"2025-08-08T13:47:00Z","snapshot_observed_at":"2026-08-12T09:06:19.675038Z","submitted_at":"2025-08-08T13:47:00Z","title":"Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:54:32.447112Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2508.06317"},"observation_digest":"sha256:b05ffbc7c67563424a7937b3e054e50a9e383122d02155c371da5aa6408e3bf9","observation_id":"fa93c31f-f6eb-454e-9388-ac956e1afd3f","resolution":{"observed_at":"2026-08-05T22:54:32.447112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-05T22:01:26.003333Z","title":"arXiv preprint arXiv:2503.13377 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:26.003333Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2508.07683"},"observation_digest":"sha256:3072a33b232d3349e71b821948511f37781b628a730c3d558e7314d0167667a7","observation_id":"6aeda5a9-ec24-4ea2-bb08-123d214dacf4","resolution":{"observed_at":"2026-08-05T22:01:26.003333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-05T23:32:18.032059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.032059Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:163291170d55766495d45cba5c53a9773b0b547c46dac0f968add74cd1400799","observation_id":"b7b55908-738b-43e8-aa27-bbc80aecf7be","resolution":{"observed_at":"2026-08-05T23:32:18.032059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-05T20:29:11.193788Z","title":"Wang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":288,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:11.193788Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:042f4414d1f47a51322d92ef535b0fa882adb91c6c50ad132e416e4073b33f25","observation_id":"c68a39ef-5cef-4f18-a352-8e87bf843846","resolution":{"observed_at":"2026-08-05T20:29:11.193788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-04T07:23:07.108809Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-06T20:27:36.141566Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.108809Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:5cf1c0c80b4ccee812f1643635016cead99487a80248208d3df13a30be18efb2","observation_id":"092dee13-de5c-4c06-89c5-20e794ea9026","resolution":{"observed_at":"2026-08-04T07:23:07.108809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-08-09T22:36:48.890275Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:50f7e4e54ab94162cb0c34f4a1a586e71e37c243e66e86d0a8578a79fc2855f9","observation_id":"5f14d52f-3aa6-4dab-b8e7-339eb77843a5","resolution":{"observed_at":"2026-05-17T22:25:22.540751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2511.13026","last_updated":"2026-05-14T09:07:42Z","snapshot_observed_at":"2026-08-11T13:00:40.881966Z","submitted_at":"2025-11-17T06:25:12Z","title":"REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T22:19:36.366837Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2511.13026"},"observation_digest":"sha256:0e670c233e4824748067b608b909dbea5f168906834735067f5d325a1db20902","observation_id":"43b4d501-e9a5-4dd1-b1f0-1aa7af507935","resolution":{"observed_at":"2026-05-17T22:20:22.937278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-08-12T14:21:45.818304Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:82409bc82ade60f1a9fdc568d879347fe55b375c0138e2a7a16cc4d4463d496b","observation_id":"e0cb23fb-6be2-490f-aad7-b67241350fb9","resolution":{"observed_at":"2026-05-22T12:31:32.196643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-10T21:08:10.223339Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:35ce8dcead2ef4125465b819f2e20590de8cea609b4ee2bd22eda2d2552a9223","observation_id":"9b187b0f-a38d-45a9-a9db-c82b763254f3","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-08-11T03:45:42.619022Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:1056ce12f0f90e0469f18825781cefb13da84eb007163fc70a344125c4dfc342","observation_id":"fb327704-a237-408e-84ee-7a14cf52e717","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-03T18:22:31.236016Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:31.236016Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:9a9aad6387036a20f790bee345a0e1ad9c04f3b9d0805d91dc8eff9002174440","observation_id":"092753b1-aab3-4aee-806c-3130dd836dc9","resolution":{"observed_at":"2026-08-03T18:22:31.236016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-12T12:30:05.677115Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:3c59494c0b40512a9fc848683ab88b263d9083ac5d9061ce92ef55e481197e0c","observation_id":"c3eb714c-6453-48d2-84e9-d25fe74e9893","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:f9d2c0c637c51c3f65cb6f4b07bc979b328c3b189baa545d38c53b8c53e1a638","observation_id":"6bc99a11-4a63-499f-ab31-df0d8b8969e7","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2602.17555","last_updated":"2026-05-13T14:09:57Z","snapshot_observed_at":"2026-08-02T08:53:32.433698Z","submitted_at":"2026-02-19T17:09:30Z","title":"GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T20:48:44.933542Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2602.17555"},"observation_digest":"sha256:05bbcb04196ecf29af85040c9dc3a95b5caeec56b2943f9820a8ada2efe2b037","observation_id":"4495bbd2-de89-44cc-a83e-b0b39d756171","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"arXiv preprint arXiv:2503.13377 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-12T05:03:34.125157Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:ec84519358fa8e41b50b414fd4b9ed55a10a409265750e2e8039eba11d0c8a1a","observation_id":"b1878c71-7d1b-42b3-a3cf-d3016bbb1f29","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.01824","last_updated":"2026-05-10T14:15:29Z","snapshot_observed_at":"2026-08-11T12:35:00.734309Z","submitted_at":"2026-04-02T09:35:27Z","title":"STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T21:12:29.596207Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.01824"},"observation_digest":"sha256:40865ca22ad409a101591954f8600eab2e6f65ea422c16762b59a559bcbfc95c","observation_id":"d177492b-4fd6-4df0-9a25-d1f3229a1487","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:23f62cab46ef85357958fc6c332671a42d9cec5b8683478d611544a41b912256","observation_id":"556f6a39-46e1-4030-bf4d-23a5f96c1067","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Time-r1: Post-training large vision language model for temporal video grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ec7a929e14b98aa57c188a8a42aa56e50b1306a9d3a9fd4eab52f64769f8a330","observation_id":"5e8ebaf9-3410-4ae5-bd62-0a945189ece1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.13715","last_updated":"2026-04-15T10:50:29Z","snapshot_observed_at":"2026-08-11T14:08:30.224174Z","submitted_at":"2026-04-15T10:50:29Z","title":"Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T12:37:17.843365Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.13715"},"observation_digest":"sha256:b8c1e911519d5ece1a4c60215a656851973a9c8eedde28cf8e4fc0371c482085","observation_id":"1f3062b4-9aed-4595-859c-7a7a414ca15e","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.18665","last_updated":"2026-04-20T14:40:43Z","snapshot_observed_at":"2026-07-06T23:05:30.879164Z","submitted_at":"2026-04-20T14:40:43Z","title":"APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:12.783993Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.18665"},"observation_digest":"sha256:d072d0c6d6655e28ffb4f2874176998445701978f4b14e8848de39d011a3b2ef","observation_id":"d80fae7a-6546-44ee-8e6a-ea9528528f23","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.20473","last_updated":"2026-04-22T12:02:24Z","snapshot_observed_at":"2026-08-12T17:34:27.593639Z","submitted_at":"2026-04-22T12:02:24Z","title":"Video-ToC: Video Tree-of-Cue Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:29.374012Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.20473"},"observation_digest":"sha256:098ce2e31e79f658371be5a9eab69f6e8cc0111c85d93acb3465a3c45de60d3a","observation_id":"87db41aa-b680-4d07-b2e5-55283a5d870f","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-08-11T05:21:52.457685Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T12:45:50.422679Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:ea3bbc57c06f478005bf10a7bcb1d28b5f34fb6bf2cecc3b212309f34572538d","observation_id":"3dc60eae-4c0e-466a-8773-d25ec3fb2e34","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":"arXiv preprint arXiv:2503.13377 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-08-11T05:21:52.457685Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:fcab189585e2b6b50f855d16f112189ff3faea82b3978d9099318f5bb143b2df","observation_id":"e5200291-cb6f-42a9-b04c-0cc105e58cb3","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.22836","last_updated":"2026-04-20T14:36:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-20T14:36:19Z","title":"AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:14:25.423302Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.22836"},"observation_digest":"sha256:7050c9df6b9b527bb69199bb602680a222cef8de074480b66082b3aa05e96787","observation_id":"d5ed8ec9-9d40-43d4-a267-4c05d366684a","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.25276","last_updated":"2026-04-28T06:34:19Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T06:34:19Z","title":"OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T16:51:43.783133Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.25276"},"observation_digest":"sha256:499a5c6b8bab94df114dc7f3d1c5273ae0ce9809d8bdc390a7635db226b796ed","observation_id":"24bee16c-f63c-4f5a-8081-e71523b2584f","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:d5a3755200ef539a6b7f44c98aa02df7b0f2531d41ef7f6578d3657c3642f5f5","observation_id":"9cf10bfe-4981-4ecf-9d99-11d5955202f0","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T14:06:27.953376Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:3bef2a8ac04398b5688288d1b9c53a53814e8b796fa2a38f6d3ff4d87e27e738","observation_id":"0e3d2f1d-0933-43a4-ae2d-945ea35d1fa3","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:41.654207Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:01a717bf108c2f21f17537126e07c24b3bcae4fe5864a76b50f86a4c5abd2a58","observation_id":"df3f111c-e38b-4cf7-9430-3a8e53b84360","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:59.553683Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:764c2f32703de1432f9e4aaa0f94cf338fd2ccb04ec81405fff93aaed530afd7","observation_id":"ba62a7b2-e7d0-4945-ae60-f46f4bbe7630","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-11T13:33:33.675814Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T06:08:19.956833Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:4d75c9ab392dbc24d085e45e4ec55f7070920313220840c8039e5feee0e7d97a","observation_id":"4a13e00c-9ba8-46ef-b63d-ffc85dda9839","resolution":{"observed_at":"2026-05-25T06:10:23.838149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-08-11T15:59:30.201229Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:1c5fbe4123ff2e29ae5ca30502663cba4c04759e31f7614c4a8a20579f496fff","observation_id":"4faa07dd-96e9-45f5-943b-e21ef325d1f5","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-11T00:27:38.038120Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:15b9b7feb941fe9c392cea227f73b6d47fa5eb1fc755ba6616542e5ebed2301d","observation_id":"eb64bcdd-6264-4ce8-85f0-d4df3dd37934","resolution":{"observed_at":"2026-05-17T02:40:06.763282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-08-06T01:04:24.065010Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:86b2f1c2cb26aa621b58559f402db006ebca08ff0c2d5fa1f27ea5ee2297f3eb","observation_id":"4ceac38a-888f-45e7-b5ec-08545880b531","resolution":{"observed_at":"2026-06-30T21:35:04.398647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:fde22733097fccaf25bb25bde88668787a3dd8dfe6423572b379fe4ac67a2baf","observation_id":"87698de1-9b46-4c55-aa86-242a60097b5f","resolution":{"observed_at":"2026-05-20T19:38:56.133728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T07:32:12.180233Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:5828e53342e193a974674f3d0bec8b8e3c881a1e14e271be1b86e00530cba351","observation_id":"c317675e-1d6a-495e-a30b-121de9680c68","resolution":{"observed_at":"2026-05-21T07:34:02.631324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T08:59:28.405218Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:a7c0ade0a61c47a8650369482b3909564b793b9a421de3e44f8fad84fd8d3ada","observation_id":"e7c0e7d3-1838-4170-b85c-c3ce2f1d2511","resolution":{"observed_at":"2026-05-22T09:01:19.294041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:e83ee5642485d5c85d00adb0930b2c69e78838d4641a92b5de620fe82c52d7af","observation_id":"35d05aec-0652-4be4-b667-3eb96cb60d69","resolution":{"observed_at":"2026-05-22T07:21:12.922592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:753eb368b4743ccd08f1bd8200f0623cda5ba45fc27e9ba6e52b3391852226d3","observation_id":"8c6773e2-b13a-4afd-86f4-be124fc01250","resolution":{"observed_at":"2026-05-22T07:14:42.423672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T04:54:23.077914Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:c511c671b3975c593866263525fbc5fec360e028e1e4dd173e26db8c90d20952","observation_id":"e89650d7-ca77-497b-858f-285831a96273","resolution":{"observed_at":"2026-05-25T04:55:23.205843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2605.23216","last_updated":"2026-07-02T06:54:56Z","snapshot_observed_at":"2026-08-03T00:30:19.785022Z","submitted_at":"2026-05-22T04:19:29Z","title":"CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-04T00:41:02.284215Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2605.23216"},"observation_digest":"sha256:079e9d9ec7fca986780261c9af7a5df98ce471bdd32616280135d51fd9e7603a","observation_id":"598c87d5-05b6-469c-bbe2-d13a9179001c","resolution":{"observed_at":"2026-07-04T00:49:17.488864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:b2db1a193847e796aa64e7399251c6feb92c03a44dbd60f5cd881be48b14e9e7","observation_id":"9b9223fb-c6e2-4540-b335-32e90639ff5b","resolution":{"observed_at":"2026-07-02T12:16:57.661656Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:356dab0d3298205edfb6720440c685fcb9685beb498544a057ef34b21a26b0ec","observation_id":"cf68d152-da0c-4486-9e6e-bc9893b58257","resolution":{"observed_at":"2026-07-02T17:27:15.836506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2606.19706","last_updated":"2026-06-18T02:05:14Z","snapshot_observed_at":"2026-07-06T23:54:56.685241Z","submitted_at":"2026-06-18T02:05:14Z","title":"NEST: Narrative Event Structures in Time for Long Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T17:57:55.366051Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2606.19706"},"observation_digest":"sha256:5707ab1e83693d3b49cdf6da9d289dd156eba7ad8328e869796ee94cd87ba841","observation_id":"b1e67d90-a1a5-45cd-a365-3bf83f3ce2d4","resolution":{"observed_at":"2026-07-04T03:29:31.224782Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2606.22870","last_updated":"2026-06-22T05:29:30Z","snapshot_observed_at":"2026-07-06T23:57:42.632111Z","submitted_at":"2026-06-22T05:29:30Z","title":"VideoLatent: Video-Language Learning via Latent Self-Forcing","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-26T09:25:14.441526Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2606.22870"},"observation_digest":"sha256:22c917ebcb70f749f45e521917bac4136d66eb7a570da191aa982ac29accfba9","observation_id":"94b3e95d-b8e4-46ef-ad21-ef862a41684a","resolution":{"observed_at":"2026-07-04T09:49:44.697249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":"2503.13377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-04T09:49:44.696023Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","venue":"cs.CV","work_id":"ef2c21b6-ae25-436a-bac3-f8d625541320","year":2025},"citing_paper":{"arxiv_id":"2607.00672","last_updated":"2026-07-01T09:18:59Z","snapshot_observed_at":"2026-07-07T00:06:20.346610Z","submitted_at":"2026-07-01T09:18:59Z","title":"DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-02T14:27:15.302565Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.00672"},"observation_digest":"sha256:0c00920186f6ce641f84af6884e53e4f74a0bdc55a6c98633aab9d5424fdaffc","observation_id":"1e7841c4-0434-4cea-b3ac-ea001b0d250f","resolution":{"observed_at":"2026-07-02T14:37:03.232673Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2503.13377 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-09T08:34:06.125045Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:96ba55be9d2d3b00a16b95a7c5abb2bc9c38c7c894693a1da81efd2822fae439","observation_id":"3ebdf02f-ac69-48be-bd01-caf85a2ca558","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-11T08:59:46.244502Z","title":"arXiv preprint arXiv:2503.13377 (2025) 18 H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05089","last_updated":"2026-07-06T13:50:15Z","snapshot_observed_at":"2026-07-11T08:59:45.751461Z","submitted_at":"2026-07-06T13:50:15Z","title":"TimeThink: Reasoning with Time for Video LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T08:59:46.244502Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.05089"},"observation_digest":"sha256:e391e95cb0c8af2bdf052714720f526f8f7320c47df8b9e074376dccba385c19","observation_id":"983ab6fb-dc9e-4efa-8b06-00dce13acfc7","resolution":{"observed_at":"2026-07-11T08:59:46.244502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-01T21:09:45.070624Z","title":"TimeZero: Temporal video grounding with reasoning-guided LVLM.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-08T05:22:33.805882Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:45.070624Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:30135653295827001b47d7f4f71d8691b623a3d3c8bac3117b0949408f7cce2f","observation_id":"c4169a6b-2f5d-4b69-910a-9db16aedc76f","resolution":{"observed_at":"2026-08-01T21:09:45.070624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-01T18:04:16.679249Z","title":"Time-r1: Post-training large vision language model for temporal video grounding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:16.679249Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:c498020fe4949862d3e16368537d2be686539b89ce4f48d04904a93967df6edc","observation_id":"0841f998-78fb-4532-98b2-2e9a50486d46","resolution":{"observed_at":"2026-08-01T18:04:16.679249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-07-31T23:32:54.162233Z","title":"Time-r1: Post-training large vision language model for temporal video grounding.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:54.162233Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:485831853ffb5b8602e3868826643809e27e17f62226f6239b35d8ad1e66e356","observation_id":"40c6cb9f-a569-4123-b64e-02ba7a841a4d","resolution":{"observed_at":"2026-07-31T23:32:54.162233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-10T18:13:44.215349Z","title":"Time-r1: Post-training large vision language model for temporal video grounding.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T20:11:00.312878Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.215349Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5f75c251d36bddb709eeab5ef9c4d9c38a6bc8ff9d81d7fbcd2265099f652c10","observation_id":"cf7d5b55-0444-40c4-aacb-a628a9681f73","resolution":{"observed_at":"2026-08-10T18:13:44.215349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-10T04:59:13.736545Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07417","last_updated":"2026-08-07T17:02:02Z","snapshot_observed_at":"2026-08-12T20:12:24.097509Z","submitted_at":"2026-08-07T17:02:02Z","title":"I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T04:59:13.736545Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2608.07417"},"observation_digest":"sha256:5abbd663c61902582ab99176ac93808c202f356a472256ac42281ac541a3d425","observation_id":"1c7eacd8-50a3-4af6-b457-574f29e6d56f","resolution":{"observed_at":"2026-08-10T04:59:13.736545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.13377/citation-record","integrity":"/paper/2503.13377/integrity","json":"/paper/2503.13377/citation-record.json","paper":"/paper/2503.13377"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:8c3df39d06aa233860888761d159e0c6d19d8df25d0a2a6df917dce3c4854db0","observation_id":"096c1a33-4843-4c20-92da-e0ce2affb49c","resolution":{"observed_at":"2026-05-17T02:40:06.573742Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ht- step: Aligning instructional articles with how-to videos","venue":null,"work_id":"8245457b-ee59-461c-8839-ff57852b9855","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:dc246e8dc7c340e396715dfd22443328ac2249be2cfa6607c856f5480d6badf0","observation_id":"e61632f0-3b9a-4f38-ba2c-f454ec0df487","resolution":{"observed_at":"2026-05-17T02:40:06.726653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing moments in video with natural language","venue":null,"work_id":"00e6da62-472c-45ac-a3ba-63660f0581c5","year":2017},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:b4a4edbd7cebcf46c74a9babb4742310bcbd62ef7fa888c025e855ae83eb96f4","observation_id":"e2ef44aa-49b9-40a7-8309-e4a21faae837","resolution":{"observed_at":"2026-05-17T02:40:06.728902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:1f84d1eac08a6d6cd3271cdc99ee289c060e5ae6a93e22526feedfc0d15f0607","observation_id":"ee4c2169-a8cb-459f-a967-4ed71a2d93ad","resolution":{"observed_at":"2026-05-17T02:40:06.507723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"2f0f351a-b69d-4767-8213-6807af5fda95","year":2015},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:3e0de72ff971f3af79d883df544982f2bfa06692273ed4478d7c9ef0ec31963f","observation_id":"c5ea3db8-702b-44c1-afe5-c9b46f2a8aaf","resolution":{"observed_at":"2026-05-17T02:40:06.731397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"8b317216-ec6f-4dd3-ab43-c21559677320","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:4e9cbf5db83af4900a2c6691e27bc3127a7919b123a6700d171e38e4ff1bbc4b","observation_id":"23757ce9-7cf5-4e21-acd0-efa2698440a5","resolution":{"observed_at":"2026-05-17T02:40:06.733491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":"4219231e-23b1-4125-ba53-4ba51d9a0ed4","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:e5dad304e6c78f1c4eb5fcbfd915fe79d7c7dbf781a9deab515e5bec538e56b2","observation_id":"6a476057-7e8f-4ff9-bc39-04119bafc60f","resolution":{"observed_at":"2026-05-17T02:40:06.735812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"d2a86a81-5572-4def-9f0e-242d84bed770","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:8c4ad0c7830e71c3413043ee2ab2d75fa040d94d1a3c0d69407a4c98a34e7961","observation_id":"9a5d427b-7514-4874-add1-6467a324e001","resolution":{"observed_at":"2026-05-17T02:40:06.738373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Space-time gestures","venue":null,"work_id":"7bbb6caf-7161-488c-add6-c13c2c308702","year":1993},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:e9ffc4f9d29fe8790820aa9b84a9cd6df057547b004587ec5077a11737060357","observation_id":"f43f72c3-cd01-4541-ba18-6a13ad6c8519","resolution":{"observed_at":"2026-05-17T02:40:06.740776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5: Our most intelligent ai model","venue":null,"work_id":"31f3cb0b-785d-44d9-95a4-b2b28b31bea1","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:e83d74bdb8d79a83238e8426d7030ca2c589232f1fc17191d29e682259156877","observation_id":"2c13ca72-7eb0-4508-9ce8-1c02e190ced2","resolution":{"observed_at":"2026-05-17T02:40:06.743001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:0dde2eae7ea0d5cfd045e982a735f445a997c4315752b188d8afa792171f4b1a","observation_id":"3223d133-1d40-49f7-9453-fb96ce97b930","resolution":{"observed_at":"2026-05-17T02:40:06.554694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"71a93660-b4f5-4f83-8dee-728b7f3a686e","year":2019},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:722ac545480f75cd3f766399c45797a95671b1644fc73dfb29c114a32afbb1e1","observation_id":"fa54be3e-b58e-4f18-aded-7e569bad7d7b","resolution":{"observed_at":"2026-05-17T02:40:06.745512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"e1d37636-6ace-45ad-8040-a2f9734e4ad1","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:4a106848d78b7011e9ddce9520552310023032a11b2e6c02a8b1bce893fe3336","observation_id":"9d6d75e6-3091-490a-930b-8337c7f39a16","resolution":{"observed_at":"2026-05-17T02:40:06.747757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal localization of actions with actoms","venue":null,"work_id":"b9042c12-af40-4ec2-ab91-bebea2237a97","year":2013},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:fbe22321cbeb9c455b49a50eb4af399fde08f79d7b3358bd854e8881fd69178c","observation_id":"5e55fd23-8794-4d2e-bc3a-51d5f22a30cb","resolution":{"observed_at":"2026-05-17T02:40:06.750429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"b8f1defd-8778-4cb8-9f34-5b3251ff009c","year":2017},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:6b43b775ec0dc80abc92d7f5366159967ec205b432cff640493a36431971d7b4","observation_id":"43375593-cc1d-44d5-a288-6f65c76d8cc3","resolution":{"observed_at":"2026-05-17T02:40:06.753043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"6752e34c-a49d-4be1-9772-aba59838c0e5","year":2022},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:444bc9fd43c54affe3f3782fe622f5e8683b1bd7cd6e6e3b7e6ed42f35d65eb5","observation_id":"08d09f77-dc32-4adf-a481-0249d88cf950","resolution":{"observed_at":"2026-05-17T02:40:06.755326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":"eb098023-3c5d-428d-bee9-2e5c0babc207","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:e89fd194367605bb09d8204d9d865bd38c519a8ab22f7c548038c83df3e6d565","observation_id":"12ebfb1b-4d40-4fd9-9038-7786c0f35795","resolution":{"observed_at":"2026-05-17T02:40:06.757551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05643","last_updated":"2025-03-03T10:28:30Z","snapshot_observed_at":"2026-08-11T14:35:11.755465Z","submitted_at":"2024-10-08T02:46:30Z","title":"TRACE: Temporal Grounding Video LLM via Causal Event Modeling","version":3},"cited_work":{"arxiv_id":"2410.05643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05643","snapshot_observed_at":"2026-07-02T12:16:57.678370Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"b2af5095-2950-48b5-af5e-270218b8d041","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2410.05643","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:1d3c10ccf69f891e0696686fd5a6573de652c25c4a0eaaceb7bd8361aa295517","observation_id":"19caab2e-e0db-403e-ac63-bf1a537f359b","resolution":{"observed_at":"2026-05-17T02:40:06.559123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisionllm: Recursive vision-language model for temporal grounding in hour-long videos","venue":null,"work_id":"8f22749f-ee47-474e-a621-4034900d7677","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:6564b217aeece0447f3a389e5209e9071362b6f0d00c91919118e21ddbff9dc6","observation_id":"6a400c74-73e5-4ff1-a38f-e7599b192f3b","resolution":{"observed_at":"2026-05-17T02:40:06.760082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"73a6c3f2-b2a2-42db-b7c5-f87809120388","year":2022},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:adbb3f1e2969c4828947d4c6b5d7f68a7f2802afe6f25edfcf622ac07e12598c","observation_id":"0bd322c1-83a4-4854-9fd3-4f13e6bcb140","resolution":{"observed_at":"2026-05-17T02:40:06.762465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"4e8808a3-d346-40de-8c9e-d0fa4edadd08","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:b94b3e628a8e78beaeb26a0e6f72e397348cdd98fbe1abd4826ae63782cc2a67","observation_id":"1f3d2a80-e189-43d4-a033-07cd3e570de5","resolution":{"observed_at":"2026-05-17T02:40:06.577628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":"cd8d971a-209b-4bea-9f3c-f252f28bcff3","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:47ce19c1f2b4b60a1f570bb7b8c79df81b1a9ea0479c5e5c1cf9bdccf010ccc9","observation_id":"b579597b-975f-4620-bc20-fd659085394a","resolution":{"observed_at":"2026-05-17T02:40:06.581626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"7aab7a25-6631-4624-9e10-337291f9784b","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:bf12f784121669136a2866c4316188da9d1e109ff1d6249c33e496d16230d82e","observation_id":"16c6a277-cee3-4627-93bc-e820a671a932","resolution":{"observed_at":"2026-05-17T02:40:06.585180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieving actions in movies","venue":null,"work_id":"e0eb8af9-7cd6-4f9c-8e10-94405f8a7575","year":2007},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:5690591e94f9a07a9b7d4e887e3a2ac06edcf086ba86ce0fc67d6fd9458ce1ff","observation_id":"83ecb689-6839-4cf0-8971-0b82530f2539","resolution":{"observed_at":"2026-05-17T02:40:06.588828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11594","last_updated":"2025-02-18T03:59:44Z","snapshot_observed_at":"2026-08-11T20:43:20.642917Z","submitted_at":"2025-02-17T09:28:31Z","title":"iMOVE: Instance-Motion-Aware Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.11594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"imove: Instance-motion-aware video understanding","venue":null,"work_id":"9f625e16-5823-451e-a347-33acaed09833","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2502.11594","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:ecad8fe2ab08ff1a4a13070ea054a4a12dfaf7543b3b7ce11c59c4792d18d9e5","observation_id":"0b25d990-ef0e-44c3-b91b-f7586e9a8437","resolution":{"observed_at":"2026-05-17T02:40:06.493518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"22ea0e1b-da6a-4b27-b2b9-4b63499b4365","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:0a937739f02bf089e34132aa1a55342b34f43395471e5df51104f01f586b9374","observation_id":"916126f3-5e6c-4fe1-b6c8-47c8909da601","resolution":{"observed_at":"2026-05-17T02:40:06.592471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":"2501.00574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-07-04T16:49:57.265026Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","venue":"cs.CV","work_id":"52ec7cb6-1ef6-4366-a43f-d4c13fce23ad","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:9da0765667b758c67c10ceb66d997af57b6ee98b79707daedbbc97920a57cf74","observation_id":"59801fb1-50fb-4317-8a32-1acef7e4adef","resolution":{"observed_at":"2026-05-18T04:02:43.915683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-11T19:16:40.810461Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":"2504.00883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-07-03T16:18:37.298889Z","title":"Improved visual-spatial reasoning via r1-zero-like training","venue":null,"work_id":"57345232-ffec-48ff-ac2c-e58800253c84","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:195df5f45f3755992b551669b830f4b3605476dcecdc811c4741bfebda5e1415","observation_id":"cfa03b87-9845-4c98-a800-14a7f564b40f","resolution":{"observed_at":"2026-05-17T02:40:06.550790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"08d6eadd-b831-4d45-80b2-418e8d6386ec","year":2022},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f926a20f5e2d1d4ea8e7582abce33efff1c412a55ea590f77da7b8dd0cafd20f","observation_id":"a6fe9708-c2a2-4120-aee6-de805018e3d4","resolution":{"observed_at":"2026-05-17T02:40:06.595983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"4e165a36-53bc-494f-b668-fe4862fb7c40","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:7f65869e3235255d4316a0a3c9eda178d4657c03c79bcc1e35ca6bbc59e7123d","observation_id":"5ead59bf-2a9d-41f1-a14d-1875523d9552","resolution":{"observed_at":"2026-05-17T02:40:06.599563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":"2403.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-07-04T10:29:44.911015Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":"cs.CV","work_id":"88f4d72e-ee93-420a-a61e-64b02b8cc454","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:502e447425e95c060c3b8bacea9904c1ce7b6e965c32cb12f1f52fd68aad62f2","observation_id":"2c8fb89d-1652-47a9-ad68-f5abce5fe348","resolution":{"observed_at":"2026-05-17T02:46:17.144047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:be300223289f68345463a1afbdadb134edd0af0f0b28a7c0989b0fcdd40a3724","observation_id":"229a11f8-6ec8-4c1e-877a-89efe0cfa7ca","resolution":{"observed_at":"2026-05-17T02:40:06.569222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"17fd5e93-1a14-49fd-bc7a-f8c605788e3b","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:cdcd6c39bc9ee34b96f0f3b519882bce00a002aa3651602dfbb3f4f2ca843f74","observation_id":"2121138f-f80c-4055-8ca4-e9f064f465f5","resolution":{"observed_at":"2026-05-17T02:40:06.602907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior","venue":null,"work_id":"ae25c284-dc5a-4321-8ec7-9c4134dd4413","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:8554193f0c03032b7f6dc7a531b237238e66290f183e76a93e93cb42dcf3ed9b","observation_id":"37a1727a-3f48-47d6-8f2d-c82e3bd5dbf2","resolution":{"observed_at":"2026-05-17T02:40:06.606458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:5dc8b9d26dc4649e8d8220e1c437dfde405c9b5e70ea50b2c5d55ac95bbe605f","observation_id":"eb2ce270-e81c-495b-b521-a160656a4591","resolution":{"observed_at":"2026-05-17T02:40:06.512877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"7ea88a84-0eb9-45a8-8643-2e40c0422d38","year":2019},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:a6b94e97e7316c0f7e521b19cd7b7418a5eb8d7585eefa70fdd2da16725875c8","observation_id":"6ae26ceb-0ea6-4106-989c-ca8b99c7e736","resolution":{"observed_at":"2026-05-17T02:40:06.610238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":"16d417d1-18c4-42b5-bd51-f901da63ab3e","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:cf50745b084b29e4d2cbfdec3decdc082b770236eb6f0fa257e31a9b009fe41c","observation_id":"855c0589-bc9e-4713-9a19-73979d0ec93c","resolution":{"observed_at":"2026-05-17T02:40:06.613081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":"7d46b238-edfc-473a-b8d2-0adaec723681","year":2021},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:b4cd1e566d3f6539dc639928ddd85ac83dd275947c8e1a186e2e3a5a39318fa8","observation_id":"8507b6bd-8911-47d2-94cb-bfacd6a2b27d","resolution":{"observed_at":"2026-05-17T02:40:06.616428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o1","venue":null,"work_id":"d45ecb82-3805-4107-b5e2-3f571e9a2a51","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:497a12b6331984e950fedadd192798fe8b6a947e64d22a8982b469d4d64e98db","observation_id":"31298708-6ed3-4cf9-9d6e-ece7d411a55e","resolution":{"observed_at":"2026-05-17T02:40:06.619036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"cdcf9496-c95b-4b2e-8a29-7cfd375a581e","year":2022},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:d23a23908f368a42de3e59362225681681c0ae52090b4bbed407941364c2fcf4","observation_id":"f1181f51-d28e-4a5e-a059-f36ff1822e89","resolution":{"observed_at":"2026-05-17T02:40:06.621670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"b94c52d1-d7e0-481e-b083-02b77eebef32","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:4fff93d01d885a92c0d5100c2009e69b473be4b7ba793a069ac09c95c7dd5191","observation_id":"f2a44993-321b-4f5b-82b5-965363200b0f","resolution":{"observed_at":"2026-05-17T02:40:06.624221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a93a2c75-daa4-4c48-9f5b-99731bfb6631","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:216fb90b16ecc3269ff8989c525df5cb8070010f095c028488f02e5ea56eb2ae","observation_id":"cc1a7ef4-e5f6-47b5-9a6a-5cab08db7920","resolution":{"observed_at":"2026-05-17T02:40:06.626902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding action descriptions in videos","venue":null,"work_id":"47d994a3-850e-426a-a364-a2792fa60de8","year":2013},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:80d0b6ecc2e65c5e307ad5739a0a05631af87c3cf75d82f53733d4a453de28da","observation_id":"1247a069-af12-456f-a12e-87990e9d1861","resolution":{"observed_at":"2026-05-17T02:40:06.629529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"c5f703f2-f0b0-41b7-a751-e08b50ed49d9","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:be53bb8ec8f8d61da744942fda4329873eba813ced653edea98debd306e61b5a","observation_id":"c93386c5-7836-4f5d-a4e2-70c2854afbb8","resolution":{"observed_at":"2026-05-17T02:40:06.632096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:cbf8ee4ed38d29468806897a7d0c43624fda73551b729e1a487b220e4030c503","observation_id":"776c28a4-9841-49f9-b982-87d8e324bae8","resolution":{"observed_at":"2026-05-17T02:40:06.517789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding","venue":null,"work_id":"339abae5-b1bf-4301-a94e-53d6a2d05b48","year":2016},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f7166dc2c29eb18c309cb54fced43d7e8ff74fea91cb4db82779990ccf3026e5","observation_id":"be34329a-5ba4-4f07-8c99-23204cf7a19b","resolution":{"observed_at":"2026-05-17T02:40:06.635021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":"1712.01815","doi":"10.48550/arxiv.1712.01815","metadata_source":"pith","pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","venue":"cs.AI","work_id":"9978bd70-b9dd-4eb6-928b-66c2d40da222","year":2017},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:6450b4c02c05e9df5166a037861020d191576d62033ece2af2175fda6c974f2b","observation_id":"bec547c2-e15e-4994-9ade-b935f7dcc8b1","resolution":{"observed_at":"2026-05-17T02:40:06.528100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-02T13:38:12.382503+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T13:38:12.382503+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.20752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:31.462928Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":"d401306c-918a-439b-930f-b02e20f9391a","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:49e7e2a2667b17d1d14b48bff688ed5a70f15e219466c9e2f831caa7387a7c0f","observation_id":"7b00d6fe-61bc-4d53-a4ea-d4b73102bea5","resolution":{"observed_at":"2026-05-17T02:40:06.533183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:39c6df487363a5f3a68525a14c75afd6fa117e38e4c917977b8fb7e80526d908","observation_id":"af0bf21b-6be7-4169-b4fe-d7b0c07e597d","resolution":{"observed_at":"2026-05-17T02:40:06.538109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hawkeye: Training video-text llms for grounding text in videos","venue":null,"work_id":"78ea87a6-ca06-45b6-88a1-4b953d7a8f56","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:ca61ec1802e33bcfa1209c6cb67af23a4611fa4cf8c1642a33bedd2f49c19151","observation_id":"a6aba1f1-2c0c-449a-a5bc-5ba2a720944e","resolution":{"observed_at":"2026-05-17T02:40:06.637627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9cd7692f-0b8f-4de0-b30a-abb23832eb89","year":2020},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:e983c7a874817ca71e6a1d8d544e8c0066ba84303aeda6c1d66f995b74c27235","observation_id":"a188824f-9424-494d-8c8c-37732a744538","resolution":{"observed_at":"2026-05-17T02:40:06.640284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Number it: Temporal grounding videos like flipping manga","venue":null,"work_id":"a9b5e168-bfaf-4fd7-ae2a-40386c3b7b00","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:7b5cc9eacfe9c20ad6954940f3e89ce2bdf6cad3d76bba8f1c525892d2ffc76a","observation_id":"7afd85b1-2212-4dd9-962f-4510d4c0470a","resolution":{"observed_at":"2026-05-17T02:40:06.642826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"a810208b-fda7-40e9-90d7-02daf9fab6c4","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:44f11d3c96ec65985527c41d459b8be5a2d556bed7fbe8a08729156dcd2d71a5","observation_id":"47042016-d8ce-4724-81b4-50e670085c40","resolution":{"observed_at":"2026-05-17T02:40:06.645489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"08b763af-cbf8-42e2-8bb0-04a9659e8e31","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:92774a0a3c6b00fa5021fae7a76c088287fde89de768c7e154e6f1d59cce22bf","observation_id":"dcfcf2b1-ca8f-49cb-9773-83344c729dbb","resolution":{"observed_at":"2026-05-17T02:40:06.647930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"a5f91e29-8beb-4125-ad70-21537a940e1e","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:50c101f69835d84a8ab0f68318aae5421904b42b492bf1a43d346bb538e1633f","observation_id":"4c540c59-2304-492d-9cf2-6de6259cbc06","resolution":{"observed_at":"2026-05-17T02:40:06.650286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:8a4dd1ecf081f4d10ce3daa18e85e67db99a6c5d181bf5bf280c571680ac03bb","observation_id":"88fb637f-2325-443c-82ff-053f31c17ad3","resolution":{"observed_at":"2026-05-17T02:40:06.501096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"5ac88c1d-b705-4cb1-bd06-f358e4925206","year":2024},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:3639062fc3fa914068193ae3422e7b32e260b91edd267bf4c702cd710ab76e5f","observation_id":"71abcb1e-a5fb-48ea-9a87-c8f7c08a6df7","resolution":{"observed_at":"2026-05-17T02:40:06.652696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A closer look at temporal sentence grounding in videos: Dataset and metric","venue":null,"work_id":"6259088a-bfa4-4209-95e3-67630f3592db","year":2021},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:889c7bde062e4ede1576f5482876fd8b9ab21090ec66f6bbfce731b9d770621a","observation_id":"770d5252-9b0f-4a9e-a152-8dbe3e983746","resolution":{"observed_at":"2026-05-17T02:40:06.655502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"52b2951e-175a-4249-8ea0-156587d1a0ff","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:53a16aed6404bb47d7e266c0a95d082aa7bfbe6c2f1d78e6440dbfede55b8ae1","observation_id":"a30f710b-2cf7-4679-b3d3-eb390e898793","resolution":{"observed_at":"2026-05-17T02:40:06.657989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timesuite: Improving MLLMs for long video understanding via grounded tuning","venue":null,"work_id":"dbf504e3-f198-4ee9-95ac-242de7ea65cb","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:db3aa67ae97c10f8d01d77e4e0bd33fe336a9f7dd7b13f046b86a8da3439fed9","observation_id":"cc3e341c-d304-41c2-a4cc-9a7d84a37ee4","resolution":{"observed_at":"2026-05-17T02:40:06.660390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal sentence grounding in videos: A survey and future directions","venue":null,"work_id":"d7fc8960-f806-461f-8a27-10e3fae94b6a","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f2d71d7e5a6eced60658b704115d80c5c0552441847277f9ded48d9fce6acce3","observation_id":"aeb2920f-7f7b-4e2c-b315-2eb2ca6f9ae9","resolution":{"observed_at":"2026-05-17T02:40:06.662592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-scale 2d temporal adjacency networks for moment localization with natural language","venue":null,"work_id":"00891754-8918-4c54-9920-610469989082","year":2021},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:8f963d40d3ad7dc0ab192a67301a921f1470ba20a544672adf5a579a9e3c1e79","observation_id":"3473930b-d8a9-4e1a-930d-9d2f910109a6","resolution":{"observed_at":"2026-05-17T02:40:06.665055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language","venue":null,"work_id":"36a49c38-4794-4f67-901e-ae51ec2f3846","year":2020},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:072d1d853dada61ada0e168aa84001f613d9c2b65157a829d6dc407bbb04d276","observation_id":"214a3c37-a574-4ee9-bb33-fa83f116273e","resolution":{"observed_at":"2026-05-17T02:40:06.667570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-08T07:14:04.916356Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":"2504.09641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-07-04T03:29:31.402219Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reason- ing","venue":null,"work_id":"11e3dd37-02ce-4677-bd0f-38017bd9b920","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:41dd25eb47cbeaee58f95a6a4ca5977dca36e07c35b024f2c7214d6ec68c9e67","observation_id":"c6903ccf-ac39-4c50-b14e-b931bf6a40e2","resolution":{"observed_at":"2026-05-17T02:40:06.542292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07519","last_updated":"2025-04-10T07:33:39Z","snapshot_observed_at":"2026-08-10T19:22:50.204372Z","submitted_at":"2025-04-10T07:33:39Z","title":"VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.07519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07519","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoexpert: Augmented llm for temporal-sensitive video understanding","venue":null,"work_id":"8698fd70-8386-402d-a1ef-3bb63fb11bcb","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2504.07519","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:5b9c1aa75fc279c075582cddea32fec005823df0296a9e851325afb71608036c","observation_id":"d49be883-0dc4-4ac5-91cc-2ff3762cb4ee","resolution":{"observed_at":"2026-05-17T02:40:06.546326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"goes back to the pink bucket","venue":null,"work_id":"23a8395e-a865-433c-8a7d-828d469d06ad","year":2022},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:1657a6f33daf1c6add116274b122d23ad83cc2102b7e80cf4af6ecf6e4745095","observation_id":"6ecea9b7-6894-4e80-94fe-aeae55a5af41","resolution":{"observed_at":"2026-05-17T02:40:06.669897Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b2968393-0ff9-481e-b1cb-a21f0f426d20","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f081f2fff7f66b8d239a974f575c10ab00d0aec36505774619fea416f220ad18","observation_id":"16676725-fb9c-4b0f-80c1-f5b102fc4186","resolution":{"observed_at":"2026-05-17T02:40:06.672868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5de87393-826f-41b0-b299-462454327e76","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:c8d2312831262f5f396a35ee82e76e729bd2410173490841a020406ea8924f09","observation_id":"d3dec532-6633-4b06-a093-61664ada7bda","resolution":{"observed_at":"2026-05-17T02:40:06.675761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62a522e4-4b0a-4f31-ac14-db69b716fa01","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:b5fa4bed51b3a457d221032135af76e7e3db7048d424c4bd6f2dcae00e15b5d5","observation_id":"2fda06f6-df62-4bed-9597-0fcfa4e3d564","resolution":{"observed_at":"2026-05-17T02:40:06.678391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5869c70e-14f7-44ad-a667-94690915adac","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:b70c1a2e258fae8bcc0fc4be646e15b723a92ccc09c89b6ee45b3c759245e7d2","observation_id":"d3f4fd69-5c3c-49fa-afab-5d40bde1f321","resolution":{"observed_at":"2026-05-17T02:40:06.680904Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f462652-5c8d-423c-b28c-a08d8f040dbd","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:00becfabc53bb988bf8b5d62a90161c79401b51c732df59d3c55a1556e2eb2be","observation_id":"50fe21c4-4fd3-49bb-bd5a-fc8cd43834d6","resolution":{"observed_at":"2026-05-17T02:40:06.683328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Given this analysis, the pineapple is indeed being pushed forward by a person","venue":null,"work_id":"324faed9-e112-4306-8117-5a07c9cf099d","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:4d8661cc3c4615b6af2fd7359bbb08766808dd99bc1381474787b16dec3e6310","observation_id":"51f5e0d6-26d6-42a5-b103-e092533179f4","resolution":{"observed_at":"2026-05-17T02:40:06.685762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This is the first major action","venue":null,"work_id":"4541748d-37ed-4930-b315-781a5286841d","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:fea47ac1af61e17e650602daf9e8331db21fe1a485092c3064f4a4e433e5a705","observation_id":"d51a9da3-bd7d-4d81-a399-ea01118c2b79","resolution":{"observed_at":"2026-05-17T02:40:06.688251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eb3cdd8f-281e-41c5-a895-40b8cf783a48","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:5f96703e95720f279f784c11182d7af50a4618f3818e3614394e914aef648606","observation_id":"d5823636-cde7-441f-ba7d-ad0cd4062dc0","resolution":{"observed_at":"2026-05-17T02:40:06.690563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"60687d8f-1e1b-423e-99dd-6eb8f207e836","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:cdf6c65117a9493fc297cf8b78a0ecaacb12284c7abbc67ef42fc23d54d451aa","observation_id":"1ff8aebe-eebf-4020-b0be-fa2116c3ae52","resolution":{"observed_at":"2026-05-17T02:40:06.692989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Now, let's evaluate the options: (A) C folds the dress, places it on the ironing board, and then hangs it up","venue":null,"work_id":"b92bcc2c-7384-45da-bf2a-4136d3d38692","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:239e10e9f4d01a1fdcb2e429114264776704f90720d0d561b8aa7af6a0c79f71","observation_id":"c8772ad1-80f8-4ead-abaf-819868dd0505","resolution":{"observed_at":"2026-05-17T02:40:06.695767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Examples: - person opens a book over their head","venue":null,"work_id":"f4dde218-f91e-4073-8515-51800f0c8453","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:341c589f11a899bc71d48e3d2873aad03191e6d8e62f6cc9431e9bcc48eda861","observation_id":"0a1e88d2-239a-4441-b0ca-8298de99277a","resolution":{"observed_at":"2026-05-17T02:40:06.698397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"- Examples: - He is talking while several people are using rowing machines","venue":null,"work_id":"0436be1f-0006-4d45-ab1d-94e0034b0b42","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:ed37c348a3994d59b32fd01a3c52da8a415ab857cb9b73eed82d2c4b5d22200e","observation_id":"43495fd6-4926-4859-bb8b-d2a7b69a253c","resolution":{"observed_at":"2026-05-17T02:40:06.700777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"contains multiple actions, each with a clear start a nd end","venue":null,"work_id":"723e2686-fddf-4074-8610-89b0859b0cf2","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f1cd35e2dea68faad797b399e0fb8a4bcdc5848c6151e3b983b98c8d8afddfb0","observation_id":"f0c8edbd-42ad-496d-bfd3-359c92b7a16a","resolution":{"observed_at":"2026-05-17T02:40:06.703203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Posture descriptors, positional prepositions - Examples: - Several other people are in the background working out on the equipment","venue":null,"work_id":"0cd083ca-1092-45b6-baca-b26fa72b2439","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:6fb3ad623bee9619ec9ec8b664e334092c67b04bf533afd6c7c47ba7c65900e8","observation_id":"555dd73e-5504-4304-b496-108255165969","resolution":{"observed_at":"2026-05-17T02:40:06.705831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple location prepositions","venue":null,"work_id":"81100910-95ac-46d3-82df-c04c27934c70","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:46bb78dc223a25387f8407313b84f2e7a709349031ad95e44977a291a4e7841d","observation_id":"673f6430-6d99-4bc7-9e00-dfb4238aa5e0","resolution":{"observed_at":"2026-05-17T02:40:06.708144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"after/before [action]","venue":null,"work_id":"0cef3e8d-d6a8-4e82-8ee1-c40643b12166","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:ad87781fc9835dd3bce62cb9e93af69e4663699e3ceb7b2273dc48620c6f5f94","observation_id":"6f409486-3f7e-456f-b787-0e685e4f1111","resolution":{"observed_at":"2026-05-17T02:40:06.710693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Property descriptors (color/size/material) - Examples: - what material did I pick from the shelf? - what color is the toilet bin?","venue":null,"work_id":"79caa7fd-19da-416c-ac46-d740f8b10579","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:c3c587f5c529112829eba7b89096c0bddb6a3806b89356e088e09c9c7cb8db21","observation_id":"1148f522-c872-4dfa-8472-11532f8d8ef4","resolution":{"observed_at":"2026-05-17T02:40:06.713130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numeric quantifiers, plural objects - Examples: - how many tissue paper were on the floor? - how many rolls are in the tray","venue":null,"work_id":"066b65e7-21c8-47a0-bf01-b283f963721b","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:319a2ce8d21fbcf1d9ad3481187af042fea0a8ddb42a62c5c1ff933d5f382968","observation_id":"cf68276c-5f57-4f5b-bfc6-cee39bbe9229","resolution":{"observed_at":"2026-05-17T02:40:06.715764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformation verbs, completion checks - Examples: - The bulb is broken apart","venue":null,"work_id":"f55eed76-5d39-4bf8-9ba7-5c5347c3f837","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f20781dc1b200c431be563781673c825453f936000934f989307304e922e382a","observation_id":"4fd9afe7-62c0-419f-84c5-d4ed3374740c","resolution":{"observed_at":"2026-05-17T02:40:06.718304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transient elements, overlay content - Examples: - video ends with clothes/captions scrolling down","venue":null,"work_id":"9e3f7c48-8406-4580-84e2-44eec52bf129","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:c1388eaa03c88fdcbe67ac76e068c62db5504e5e09706e9dbd494b3f9a6f156d","observation_id":"46e892a4-f1b2-45a4-8c8c-707f0dff21c6","resolution":{"observed_at":"2026-05-17T02:40:06.721157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"072de986-b6c0-4193-99d3-a84b62f07ecb","year":null},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:438fb3f4ab8a2a6e9cea0f2ea0fb3aeef16af0c075fc3fdbcd81d0f7d71a13b6","observation_id":"3e0f3466-77cb-472c-bf94-0ac28d781105","resolution":{"observed_at":"2026-05-17T02:40:06.723947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":16,"verified_fuzzy":60},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 67 inbound Pith citation observations for arXiv:2503.13377."}