Pith. sign in

Paper Citation Record · LEDGER

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 4 inbound Pith citation observations for arXiv:2507.04702.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.04702 v1

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T19:47:52.748814Z

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T05:14:24.504509Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T07:14:42.403751Z

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy8
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation eba1589a-8b44-45fe-9ff7-1d5f5ffd5a23 · outbound

This paper cites BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.306047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.306047Z digest=sha256:ebdd8b45b692a82f4c34afaf8ded23b997b7689eba650a36df03e9bd9ea211ca

Observation 1fab5044-b5c9-4c31-91dc-8a0b8170da03 · outbound

This paper cites anthropic.com/news/claude-4.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning anthropic.com/news/claude-4

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.515466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.130295Z digest=sha256:0bfa1db65777f8ad927c1cfe674ca8c7853484f790c353468f1eb67f0e26a09e

Observation ede67f04-834c-4392-9d4d-c9ce9ab07642 · outbound

This paper cites In 2025 IEEE/CVF Winter Conference on Appli- cations of Computer Vision (WACV), 5336–5345.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning In 2025 IEEE/CVF Winter Conference on Appli- cations of Computer Vision (WACV), 5336–5345

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.476188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.487990Z digest=sha256:e02f06eb02aefd2d2b8e2dfdbf74f1f2079c6660c0faf9bf4a2eaa25edb5d143

Observation 7b018bd8-c39c-406d-854e-8a41c7f3bcc5 · outbound

This paper cites BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.695254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.695254Z digest=sha256:8cc00e65e9247f6b38a315f7de2295ef343c76448ce32cf2cb138cd0055d2316

Observation c4bc7e62-d089-4692-9099-0801bb3d77e5 · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.705443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.705443Z digest=sha256:442a5f4acb4d5a66df8ec26e2e8a81e5c2631c7d1283e2d0ad62c6630e01a48e

Observation 5159f353-fda2-4803-b433-6074900cf988 · outbound

This paper cites Improved Baselines with Visual Instruction Tuning.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning Improved Baselines with Visual Instruction Tuning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.710694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.710694Z digest=sha256:0405a532cde3103d208d9ce44bbad66dd368ab163483ffc8d0001113846d5925

Observation 8620a1bd-48dd-4d95-9e07-4f8550afea60 · outbound

This paper cites arXiv:2406.18113.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning arXiv:2406.18113

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.715148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.715148Z digest=sha256:07a539ef8d83765d527efeff6cb0f1056aa607cdfcda2de86f40af169645881d

Observation 5898f856-278c-4b78-91c9-7da815dcea0f · outbound

This paper cites https://openai.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning https://openai

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.399352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.719230Z digest=sha256:7ca0de12f19882025c87273d7cf4448009ff67fd2162fb0e48bb6a8f47acb3b4

Observation 3b7b90da-929e-46a5-a61f-834092662d14 · outbound

This paper cites https:// openai.com/index/introducing-o3-and-o4-mini/.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning https:// openai.com/index/introducing-o3-and-o4-mini/

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.382284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.723655Z digest=sha256:bd2819a71ece56cc0a8164edd77b674dfaa552a0fd7b1fcc5c96f9844c44b8f3

Observation 86ca351d-cbe5-4839-afb7-8bd851929189 · outbound

This paper cites arXiv:2505.06589.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning arXiv:2505.06589

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.728260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.728260Z digest=sha256:87606c774a70e0ff7c92adb96b1c74a5ed24a092f3d4de29d41de37055f49ac0

Observation b9429fee-09fc-47cf-8c99-f2f74abd21c6 · outbound

This paper cites InternVideo: General Video Foundation Models via Generative and Discriminative Learning.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning InternVideo: General Video Foundation Models via Generative and Discriminative Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.732569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.732569Z digest=sha256:2b0780f69f7aea9cb602b4858356c7a97d5da55879490bcb02fe832ec0b38318

Observation 181b8286-f0e3-43cf-8069-371c4827b030 · outbound

This paper cites Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.737642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.737642Z digest=sha256:6181f4a7f02d8c7ab94a07c99b25af1f713c0956c3e9a5957b8e89d2a2dfd75d

Observation 16df795f-a496-4bb5-9ed5-9898f8717b98 · outbound

This paper cites arXiv:2408.08872.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning arXiv:2408.08872

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.742385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.742385Z digest=sha256:010d86ffafd01dc37ef68fab5522956072cb80f88b51dc43c5935a2dc67806c3

Observation 5b099f7e-35c1-4349-a697-ba25452e77cf · outbound

This paper cites Self-Chained Image-Language Model for Video Localization and Question Answering.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning Self-Chained Image-Language Model for Video Localization and Question Answering

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.748814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.748814Z digest=sha256:0d03a95da89b7f21232f984454e94d91be4a848ac68f3165096c15319837dbd9

Observation e1fa4dda-2b45-458c-8b61-a3abf578c5a7 · outbound

This paper cites In 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , 961–.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning In 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , 961–

Reference 2015

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.432884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.680578Z digest=sha256:0147f1536361d252d5935750d44cee40431fcb70c56bb838c4fa7836b774922e

Observation e1be29e6-c6fa-4b14-af0d-07368329e29f · outbound

This paper cites In 2017 IEEE International Conference on Computer Vision (ICCV), 5277–5285.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning In 2017 IEEE International Conference on Computer Vision (ICCV), 5277–5285

Reference 2017

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.450894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.594825Z digest=sha256:13bcbbe5d40751a45756eeb25236c8a02f0701fa138591e72d86021edc0d3a58

Observation 1b709416-f6b2-4100-af1b-4e2fbfa7e9fe · outbound

This paper cites In 2019 IEEE/CVF International Conference on Computer Vision (ICCV).

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning In 2019 IEEE/CVF International Conference on Computer Vision (ICCV)

Reference 2019

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.495153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.415432Z digest=sha256:6d1be83a18ae596558e4f8dc0427ac7a2134685a3eeb09c4b847652c36ef6976

Observation 277290e8-e626-4bc7-96ec-cd21110b8e3a · outbound

This paper cites QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.690022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.690022Z digest=sha256:142d75e06619b0089f1a51c326ff5037148ac9bb6ad929e0eb4b0334c0e76e01

Observation 8f1ccedf-c89b-40bd-a1e3-657f41d1ce3c · outbound

This paper cites BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.700190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.700190Z digest=sha256:befa87056de39cc33b854e5a3fea25a5c37d23658e25b53046dac04aa8a8d4b0

Observation 633f6e99-21fe-4327-a3f2-03eeae7426be · outbound

This paper cites In 2023 IEEE/CVF International Con- ference on Computer Vision (ICCV), 13800–13810.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning In 2023 IEEE/CVF International Con- ference on Computer Vision (ICCV), 13800–13810

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T19:47:53.415409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T19:47:52.684996Z digest=sha256:421f72c10b2afccabd9db4a4bd2f0048d5881dd0119a3c6022f736ad84a96c5e

Observation 3652956f-490d-44b1-9977-cf8b15827807 · outbound

This paper cites arXiv:2410.01615.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning arXiv:2410.01615

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.664333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.664333Z digest=sha256:9f1b67727d5e0f9fe5fd6ebec3bff64e98ad35e313a87bd1df687a75496da8e3

Observation b944b9fa-d160-4d52-9b7f-a1f5506ad70f · outbound

This paper cites Qwen2.5-VL Technical Report.

Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning Qwen2.5-VL Technical Report

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T19:47:52.231531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:47:52.231531Z digest=sha256:d422909ae300f3425ea7ed491284686cd81dcd48bf9b73ef69ea9031e1d21624

Pith citing papers

Observation 68b17250-07ab-4506-9e4d-1cf7e010fee7 · inbound

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation cites this paper.

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-16T08:40:46.399907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-16T08:38:49.075457Z digest=sha256:589715efdf6873b249c925575e6544d2d31ed70d2425406860d9f7aadfc552de

Observation 71b43087-18c0-48a3-b06b-466589877ba1 · inbound

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation cites this paper.

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:24.504509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T05:14:24.504509Z digest=sha256:b8e70a3ffe8763cad1243ae3388ccb44917154a4467a3c8961df578d4a019631

Observation 982094ee-764d-4c30-be45-9d4e1bb08bdc · inbound

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues cites this paper.

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-22T07:14:42.407010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-22T07:13:43.716510Z digest=sha256:7fbde3a246bace327d29b37b1b75c55b040e63c81ff76d65b37c42630dfef735

Observation 261fc88e-489c-437d-9045-bdbcd2663435 · inbound

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding cites this paper.

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-31T23:32:54.657297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T23:32:54.657297Z digest=sha256:c975dd1bfc7ee5da583c6bdc91ce2d4208de378e23021f2c5dea168963c79f79