{"as_of":"2026-08-08T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:153514ab34322aced2f36935e306c04c709f43e441d091691ace08b331b420bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:53.366366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:45:34.780741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2412.02930","last_updated":"2026-04-19T04:24:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-04T00:50:33Z","title":"TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T08:08:01.889675Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2412.02930"},"observation_digest":"sha256:3a30417eeb857323abe69a0d3bbc7f5ccc5178a62d748c649c0174988e9aeb5c","observation_id":"50b0f709-a179-45b6-8206-a2f2a0ad7f44","resolution":{"observed_at":"2026-05-23T08:12:43.883000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:bfa9413efb19c6cf5713ca549022bcf97165a860359ed3afb442962c83147120","observation_id":"be01e423-1c7c-4337-b591-eb687d52509c","resolution":{"observed_at":"2026-05-11T01:19:59.790972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-07T12:32:53.366366Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.366366Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ffeb978f148bcef58be146548a6a5e9504a24e28e7516d5dbc05ba3c6c2fd61a","observation_id":"0f4567e2-5e6e-4036-9683-4241c6b3734d","resolution":{"observed_at":"2026-08-07T12:32:53.366366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-07T11:35:46.597000Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning.arXiv preprint arXiv:2402.11435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:46.597000Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:7bca584979146b7d3f7ef759b848a55d099b3344322060ed7091a59063911484","observation_id":"a10982dd-14f0-48e5-a377-08aea53acc44","resolution":{"observed_at":"2026-08-07T11:35:46.597000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-06T23:29:30.067653Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18071","last_updated":"2025-06-27T06:32:43Z","snapshot_observed_at":"2026-08-08T12:15:56.187844Z","submitted_at":"2025-06-22T15:39:02Z","title":"MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:29:30.067653Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2506.18071"},"observation_digest":"sha256:58d8ddc23cd4da9ac31c4727809cd40b93c8fabaeb1fefa6ab86d0af16baba55","observation_id":"8be569d4-d419-4088-9988-07dad5799294","resolution":{"observed_at":"2026-08-06T23:29:30.067653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-05T10:58:17.121792Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:17.121792Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:4bd958ed1f002e582fb69378281bb83cc9690eeb20b782327eea4b7ce1374442","observation_id":"5ff4291b-5505-4f60-b17f-e45a306f10fb","resolution":{"observed_at":"2026-08-05T10:58:17.121792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-04T19:28:33.205521Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-04T19:28:30.013718Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:33.205521Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:43eb81f5d35729cf2c5ec687c64e953b42d5250adc1596a9436b2e2a3a864d8a","observation_id":"7efcc816-3e85-4a3e-9cc1-8dabf50b7804","resolution":{"observed_at":"2026-08-04T19:28:33.205521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2509.16538","last_updated":"2026-04-19T03:58:34Z","snapshot_observed_at":"2026-08-02T22:52:02.153891Z","submitted_at":"2025-09-20T05:04:41Z","title":"VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T15:30:29.933558Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2509.16538"},"observation_digest":"sha256:3e70e3f6755e6b0c86e3e5efa98e7a16f624dbef8ef363b9865668979e533be4","observation_id":"ec1b9b00-2414-4faa-9b74-996c447d22e6","resolution":{"observed_at":"2026-05-18T15:31:33.296197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-04T07:23:05.997667Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-06T20:27:36.141566Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.997667Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:e35cad02d1964ba89e3b0076ba182621d67385461ca668a2dfa05d5a5ab59930","observation_id":"3a1bc3f7-50ca-4392-8f64-b594b993cd5a","resolution":{"observed_at":"2026-08-04T07:23:05.997667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:c2c2c5b4965218d3f4aae97d1b623f89d3cdf9588eab9d05a0918fbde112e6f7","observation_id":"6a904aa3-5c33-48a0-a3d9-cf921f28d043","resolution":{"observed_at":"2026-05-17T00:58:46.574958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.02860","last_updated":"2026-04-03T08:26:12Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T08:26:12Z","title":"A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:57.298338Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.02860"},"observation_digest":"sha256:112f5c3cef0d24a7eea505d5a69b31820007635678dce52336b09cdfecc1c6df","observation_id":"86fdd4ab-757e-4380-b271-54c50c4f88e5","resolution":{"observed_at":"2026-05-13T19:48:11.539247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.08522","last_updated":"2026-04-09T17:57:09Z","snapshot_observed_at":"2026-08-07T21:54:42.522778Z","submitted_at":"2026-04-09T17:57:09Z","title":"UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:56.385801Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.08522"},"observation_digest":"sha256:e335423ccaa4c5ad11a52c3e803e8161dab31df6678156b5c7e4a0dbd52f52c8","observation_id":"af071c90-9781-42ad-89f7-8a1f14c485c6","resolution":{"observed_at":"2026-05-11T05:51:02.364614Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.08966","last_updated":"2026-04-10T05:10:15Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:10:15Z","title":"How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:48.559703Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.08966"},"observation_digest":"sha256:ac040768498bc5d4afc629f8d519d3b586f31a550bd241bce372fa3884aee94a","observation_id":"dd9d2065-75fc-4b65-8438-46bf554faede","resolution":{"observed_at":"2026-05-11T08:05:58.914862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:31342e7677f238cee3abb94d042db2fa42a2c8b3b006aca48cbb81264725e56c","observation_id":"4021cbe0-5adb-4cb8-9565-36d55d08bf83","resolution":{"observed_at":"2026-05-11T08:30:57.163123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:1f532c252e51dac3f4c0050a7162b9b705ba8d50f18a1c7100910478045bc182","observation_id":"b14dd2fa-b7d8-4e7a-afc2-dc5e2c459a8d","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T14:10:27.416341Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:bcb93e7cf796b5e3c92ff6c1d3b05ab221790c73d2984cd9c8c55b6a4d10c37e","observation_id":"a0cdbebb-4abd-40b6-8881-85142a3cb4b5","resolution":{"observed_at":"2026-05-12T00:46:13.691919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:40dcbafa1bc75d60518cab069a35788f69f26c9a79be88a3c3aead24963dda6d","observation_id":"39369fc2-1877-4b2d-8361-27fbb69b7a60","resolution":{"observed_at":"2026-07-01T08:45:34.782509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":"2402.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-01T08:45:34.780741Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"42e525ef-2443-4613-9462-ad1276a6ed95","year":2024},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:a3ad7dbdf158313eddaaa70d1e438327c79e02100f86fa77839163cb1bcea533","observation_id":"dd8027fc-bece-45dc-9c25-dc3a93b49ead","resolution":{"observed_at":"2026-05-14T19:32:52.443094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2402.11435 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-06T15:55:47.595199Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:10f099c698cc124f3fde47de3a4e1026371f0de25c0f3c7768486d8b55af2470","observation_id":"3281bb20-1329-43e1-aeb2-697bf9968d63","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-01T18:04:15.140313Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:15.140313Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:f425b5d74cd8cdca7935e072722dc0ed38c5d8b9dd9668848b43084e7490ea8b","observation_id":"7897806b-4c5e-406a-9871-050898220aa1","resolution":{"observed_at":"2026-08-01T18:04:15.140313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-07-31T23:32:53.187826Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning.arXiv preprint arXiv:2402.11435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:53.187826Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:c92325a5988d09d65222656a4664eb995de8fd5d17f692c57041e7f264ecc36a","observation_id":"47ea5388-d49a-40d0-b310-3eabdc9ff1eb","resolution":{"observed_at":"2026-07-31T23:32:53.187826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11435/citation-record","integrity":"/paper/2402.11435/integrity","json":"/paper/2402.11435/citation-record.json","paper":"/paper/2402.11435"},"outbound":[],"paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2402.11435."}