{"as_of":"2026-08-19T02:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:231ef00fa6850aaebfab489b05e12788c0031f407c8ed7dc011a0d341196f3f9","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:47:52.748814Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:14:24.504509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T07:14:42.403751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.04702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempo-r0: A video-mllm for temporal video grounding through efficient temporal sensing reinforcement learning","venue":null,"work_id":"32e34eff-4cdd-4f05-898d-40a77e200c8a","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-14T12:19:00.856841Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2507.04702","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:589715efdf6873b249c925575e6544d2d31ed70d2425406860d9f7aadfc552de","observation_id":"68b17250-07ab-4506-9e4d-1cf7e010fee7","resolution":{"observed_at":"2026-05-16T08:40:46.399907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04702","snapshot_observed_at":"2026-08-03T05:14:24.504509Z","title":"Tempo-r0: A video-mllm for temporal video grounding through efficient temporal sensing re- inforcement learning.arXiv preprint arXiv:2507.04702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-14T12:19:00.856841Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:24.504509Z"},"links":{"cited_paper":"/paper/2507.04702","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:b8e70a3ffe8763cad1243ae3388ccb44917154a4467a3c8961df578d4a019631","observation_id":"71b43087-18c0-48a3-b06b-466589877ba1","resolution":{"observed_at":"2026-08-03T05:14:24.504509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.04702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempo-r0: A video-mllm for temporal video grounding through efficient temporal sensing reinforcement learning","venue":null,"work_id":"32e34eff-4cdd-4f05-898d-40a77e200c8a","year":2025},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2507.04702","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:7fbde3a246bace327d29b37b1b75c55b040e63c81ff76d65b37c42630dfef735","observation_id":"982094ee-764d-4c30-be45-9d4e1bb08bdc","resolution":{"observed_at":"2026-05-22T07:14:42.407010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04702","snapshot_observed_at":"2026-07-31T23:32:54.657297Z","title":"Tempo-r0: A video-mllm for temporal video grounding through efficient temporal sensing reinforcement learning.arXiv preprint arXiv:2507.04702, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-08-16T00:05:24.719723Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:54.657297Z"},"links":{"cited_paper":"/paper/2507.04702","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:c975dd1bfc7ee5da583c6bdc91ce2d4208de378e23021f2c5dea168963c79f79","observation_id":"261fc88e-489c-437d-9045-bdbcd2663435","resolution":{"observed_at":"2026-07-31T23:32:54.657297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04702/citation-record","integrity":"/paper/2507.04702/integrity","json":"/paper/2507.04702/citation-record.json","paper":"/paper/2507.04702"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-06T19:47:52.306047Z","title":"arXiv:2505.09568","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.306047Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:ebdd8b45b692a82f4c34afaf8ded23b997b7689eba650a36df03e9bd9ea211ca","observation_id":"eba1589a-8b44-45fe-9ff7-1d5f5ffd5a23","resolution":{"observed_at":"2026-08-06T19:47:52.306047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.508318Z","title":"anthropic.com/news/claude-4","venue":null,"work_id":"ab4b81b2-0792-4bea-8b68-6b313c129e69","year":2025},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.130295Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:0bfa1db65777f8ad927c1cfe674ca8c7853484f790c353468f1eb67f0e26a09e","observation_id":"1fab5044-b5c9-4c31-91dc-8a0b8170da03","resolution":{"observed_at":"2026-08-06T19:47:53.515466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.466378Z","title":"In 2025 IEEE/CVF Winter Conference on Appli- cations of Computer Vision (WACV), 5336–5345","venue":null,"work_id":"4e3c46e8-45a6-4a88-9ecd-6603e8e39301","year":2025},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.487990Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:e02f06eb02aefd2d2b8e2dfdbf74f1f2079c6660c0faf9bf4a2eaa25edb5d143","observation_id":"ede67f04-834c-4392-9d4d-c9ce9ab07642","resolution":{"observed_at":"2026-08-06T19:47:53.476188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T19:47:52.695254Z","title":"arXiv:2301.12597","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.695254Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:8cc00e65e9247f6b38a315f7de2295ef343c76448ce32cf2cb138cd0055d2316","observation_id":"7b018bd8-c39c-406d-854e-8a41c7f3bcc5","resolution":{"observed_at":"2026-08-06T19:47:52.695254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:47:52.705443Z","title":"arXiv:2504.06958","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.705443Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:442a5f4acb4d5a66df8ec26e2e8a81e5c2631c7d1283e2d0ad62c6630e01a48e","observation_id":"c4bc7e62-d089-4692-9099-0801bb3d77e5","resolution":{"observed_at":"2026-08-06T19:47:52.705443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T19:47:52.710694Z","title":"arXiv:2310.03744","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.710694Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:0405a532cde3103d208d9ce44bbad66dd368ab163483ffc8d0001113846d5925","observation_id":"5159f353-fda2-4803-b433-6074900cf988","resolution":{"observed_at":"2026-08-06T19:47:52.710694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:52.715148Z","title":"arXiv:2406.18113","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.715148Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:07a539ef8d83765d527efeff6cb0f1056aa607cdfcda2de86f40af169645881d","observation_id":"8620a1bd-48dd-4d95-9e07-4f8550afea60","resolution":{"observed_at":"2026-08-06T19:47:52.715148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.394248Z","title":"https://openai","venue":null,"work_id":"4c309284-1d67-48aa-a2a4-e1245f45b1a8","year":2025},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.719230Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:7ca0de12f19882025c87273d7cf4448009ff67fd2162fb0e48bb6a8f47acb3b4","observation_id":"5898f856-278c-4b78-91c9-7da815dcea0f","resolution":{"observed_at":"2026-08-06T19:47:53.399352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.374479Z","title":"https:// openai.com/index/introducing-o3-and-o4-mini/","venue":null,"work_id":"52ed1db8-4067-4f01-bbb6-4f4370ea9247","year":2025},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.723655Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:bd2819a71ece56cc0a8164edd77b674dfaa552a0fd7b1fcc5c96f9844c44b8f3","observation_id":"3b7b90da-929e-46a5-a61f-834092662d14","resolution":{"observed_at":"2026-08-06T19:47:53.382284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:52.728260Z","title":"arXiv:2505.06589","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.728260Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:87606c774a70e0ff7c92adb96b1c74a5ed24a092f3d4de29d41de37055f49ac0","observation_id":"86ca351d-cbe5-4839-afb7-8bd851929189","resolution":{"observed_at":"2026-08-06T19:47:52.728260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:47:52.732569Z","title":"arXiv:2212.03191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.732569Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:2b0780f69f7aea9cb602b4858356c7a97d5da55879490bcb02fe832ec0b38318","observation_id":"b9429fee-09fc-47cf-8c99-f2f74abd21c6","resolution":{"observed_at":"2026-08-06T19:47:52.732569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-14T02:35:09.273544Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T19:47:52.737642Z","title":"arXiv:2503.13377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.737642Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:6181f4a7f02d8c7ab94a07c99b25af1f713c0956c3e9a5957b8e89d2a2dfd75d","observation_id":"181b8286-f0e3-43cf-8069-371c4827b030","resolution":{"observed_at":"2026-08-06T19:47:52.737642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:52.742385Z","title":"arXiv:2408.08872","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.742385Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:010d86ffafd01dc37ef68fab5522956072cb80f88b51dc43c5935a2dc67806c3","observation_id":"16df795f-a496-4bb5-9ed5-9898f8717b98","resolution":{"observed_at":"2026-08-06T19:47:52.742385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06988","last_updated":"2023-11-29T21:24:35Z","snapshot_observed_at":"2026-08-16T15:33:46.977589Z","submitted_at":"2023-05-11T17:23:00Z","title":"Self-Chained Image-Language Model for Video Localization and Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06988","snapshot_observed_at":"2026-08-06T19:47:52.748814Z","title":"arXiv:2305.06988","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.748814Z"},"links":{"cited_paper":"/paper/2305.06988","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:0d03a95da89b7f21232f984454e94d91be4a848ac68f3165096c15319837dbd9","observation_id":"5b099f7e-35c1-4349-a697-ba25452e77cf","resolution":{"observed_at":"2026-08-06T19:47:52.748814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.426577Z","title":"In 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , 961–","venue":null,"work_id":"f6332e70-a94f-4d9b-b845-bad7ba39b225","year":2015},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.680578Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:0147f1536361d252d5935750d44cee40431fcb70c56bb838c4fa7836b774922e","observation_id":"e1fa4dda-2b45-458c-8b61-a3abf578c5a7","resolution":{"observed_at":"2026-08-06T19:47:53.432884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.444915Z","title":"In 2017 IEEE International Conference on Computer Vision (ICCV), 5277–5285","venue":null,"work_id":"3ec2e057-95e8-4d35-89be-6d1808e9778a","year":2017},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.594825Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:13bcbbe5d40751a45756eeb25236c8a02f0701fa138591e72d86021edc0d3a58","observation_id":"e1be29e6-c6fa-4b14-af0d-07368329e29f","resolution":{"observed_at":"2026-08-06T19:47:53.450894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.488573Z","title":"In 2019 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"a389de05-ee90-42f8-b985-a8c678885f6f","year":2019},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.415432Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:6d1be83a18ae596558e4f8dc0427ac7a2134685a3eeb09c4b847652c36ef6976","observation_id":"1b709416-f6b2-4100-af1b-4e2fbfa7e9fe","resolution":{"observed_at":"2026-08-06T19:47:53.495153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09609","last_updated":"2021-11-29T18:35:51Z","snapshot_observed_at":"2026-08-16T18:08:44.225996Z","submitted_at":"2021-07-20T16:42:58Z","title":"QVHighlights: Detecting Moments and Highlights in Videos via Natural Language Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09609","snapshot_observed_at":"2026-08-06T19:47:52.690022Z","title":"arXiv:2107.09609","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.690022Z"},"links":{"cited_paper":"/paper/2107.09609","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:142d75e06619b0089f1a51c326ff5037148ac9bb6ad929e0eb4b0334c0e76e01","observation_id":"277290e8-e626-4bc7-96ec-cd21110b8e3a","resolution":{"observed_at":"2026-08-06T19:47:52.690022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-18T14:15:48.297060Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:47:52.700190Z","title":"arXiv:2201.12086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.700190Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:befa87056de39cc33b854e5a3fea25a5c37d23658e25b53046dac04aa8a8d4b0","observation_id":"8f1ccedf-c89b-40bd-a1e3-657f41d1ce3c","resolution":{"observed_at":"2026-08-06T19:47:52.700190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:53.410126Z","title":"In 2023 IEEE/CVF International Con- ference on Computer Vision (ICCV), 13800–13810","venue":null,"work_id":"187bee3c-abdb-4adf-b126-0c2b7428ca6d","year":2023},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.684996Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:421f72c10b2afccabd9db4a4bd2f0048d5881dd0119a3c6022f736ad84a96c5e","observation_id":"633f6e99-21fe-4327-a3f2-03eeae7426be","resolution":{"observed_at":"2026-08-06T19:47:53.415409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:52.664333Z","title":"arXiv:2410.01615","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.664333Z"},"links":{"citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:9f1b67727d5e0f9fe5fd6ebec3bff64e98ad35e313a87bd1df687a75496da8e3","observation_id":"3652956f-490d-44b1-9977-cf8b15827807","resolution":{"observed_at":"2026-08-06T19:47:52.664333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:47:52.231531Z","title":"arXiv:2502.13923","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.231531Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:d422909ae300f3425ea7ed491284686cd81dcd48bf9b73ef69ea9031e1d21624","observation_id":"b944b9fa-d160-4d52-9b7f-a1f5506ad70f","resolution":{"observed_at":"2026-08-06T19:47:52.231531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 4 inbound Pith citation observations for arXiv:2507.04702."}