{"as_of":"2026-08-20T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:016a2b845adb9635c234be644b4d8cb20ae3933a84e3d350ba55184efc1d5fd0","coverage":[{"denominator":164,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:32:17.911414Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:27:58.123306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:29:31.264199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10922","snapshot_observed_at":"2026-08-04T13:27:58.123306Z","title":"A survey on video temporal grounding with multimodal large language model.arXiv preprint arXiv:2508.10922, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-14T01:20:42.424375Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.123306Z"},"links":{"cited_paper":"/paper/2508.10922","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:f9e0f84c3e913b2f83a2d3c275c8f080860dad46a4517625784ee4903d62bc71","observation_id":"88ca922f-510e-4504-9f08-5e73b4c37d34","resolution":{"observed_at":"2026-08-04T13:27:58.123306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2508.10922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10922","snapshot_observed_at":"2026-07-04T03:29:31.264199Z","title":"arXiv preprint arXiv:2508.10922 , year =","venue":null,"work_id":"c2d3a20e-54e1-40a3-95fa-d2017dc2bb6a","year":2025},"citing_paper":{"arxiv_id":"2606.12300","last_updated":"2026-06-10T16:35:04Z","snapshot_observed_at":"2026-08-19T08:55:45.022110Z","submitted_at":"2026-06-10T16:35:04Z","title":"Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T10:01:09.933880Z"},"links":{"cited_paper":"/paper/2508.10922","citing_paper":"/paper/2606.12300"},"observation_digest":"sha256:87262dfd3d8c299f2eaa4130c21adcc043a3db15e11681cf453c94b73b2ca930","observation_id":"c62788a6-7f32-4a43-bd09-750b057d5d86","resolution":{"observed_at":"2026-07-03T10:27:56.646763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2508.10922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10922","snapshot_observed_at":"2026-07-04T03:29:31.264199Z","title":"arXiv preprint arXiv:2508.10922 , year =","venue":null,"work_id":"c2d3a20e-54e1-40a3-95fa-d2017dc2bb6a","year":2025},"citing_paper":{"arxiv_id":"2606.19706","last_updated":"2026-06-18T02:05:14Z","snapshot_observed_at":"2026-08-15T10:55:58.062966Z","submitted_at":"2026-06-18T02:05:14Z","title":"NEST: Narrative Event Structures in Time for Long Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T17:57:55.366051Z"},"links":{"cited_paper":"/paper/2508.10922","citing_paper":"/paper/2606.19706"},"observation_digest":"sha256:c0d6cec8eb5622cbf4894d5414801cc48bce2b31d527f055837c3c67c7bed9a5","observation_id":"b4dd3e4b-6a31-4ccd-b5c9-eab64f69718f","resolution":{"observed_at":"2026-07-04T03:29:31.266362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10922/citation-record","integrity":"/paper/2508.10922/integrity","json":"/paper/2508.10922/citation-record.json","paper":"/paper/2508.10922"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.435157Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.435157Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:33a5cac67020746da5b42a57c4e31da9dd1a0747dbcd3f629b16ec57a08d3e6a","observation_id":"d47efee2-bed4-4c74-8608-84941efa5a9a","resolution":{"observed_at":"2026-08-05T23:32:17.435157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T23:32:17.441242Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.441242Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:9f65b43247d9f9dedad570e70c313531ea4e9f9e26946b0a674d77c535fac3db","observation_id":"b6867581-5b02-4758-9364-ed0c7a825638","resolution":{"observed_at":"2026-08-05T23:32:17.441242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.446542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.446542Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:1f2b90f7b99fa8c3570ed435be22617e35b7452cc4a8e428caea46b5f7567ae5","observation_id":"f1c7ca98-9471-4fc4-aba7-1f20aa7d5cbd","resolution":{"observed_at":"2026-08-05T23:32:17.446542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.451571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.451571Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:73eccde0bfed9086674f226a2a1caa53a16a023413d5e61604a593f7eb45daa9","observation_id":"710efd66-7ff8-480c-b180-e74d17545b68","resolution":{"observed_at":"2026-08-05T23:32:17.451571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.458333Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.458333Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:28a81fa5af4a4ec762aecb93b70c7d3fb022feda4c9ec2b743cec48068cb8a69","observation_id":"d3dd2b83-3a52-41f0-b953-5241e969b2e0","resolution":{"observed_at":"2026-08-05T23:32:17.458333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.464199Z","title":"Regneri, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.464199Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c4a2c98818d5dc4b8b83395bae669b71da729d450a0f3a3661599b62caa8dcdd","observation_id":"95f37fb3-323d-4daf-9765-a459f1fadd24","resolution":{"observed_at":"2026-08-05T23:32:17.464199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.469635Z","title":"Anne Hendricks, O","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.469635Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2efcae295ae4f8d922f49cd4585e3ce196f21c55672fc1cddd62bb57acf7872a","observation_id":"b3dd524e-b921-401e-99ae-cc67967b3084","resolution":{"observed_at":"2026-08-05T23:32:17.469635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.475076Z","title":"Krishna, K","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.475076Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0cb54c08b594c4c53740725b343958b102e601365e0a35a49fb330e31d36e314","observation_id":"161fa926-d0a6-4d94-81f0-88a26f8fd460","resolution":{"observed_at":"2026-08-05T23:32:17.475076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.479960Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.479960Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:9ce4c805174074ce7c66e06f14bfa1497f865d7601b69f61099598b724ca2228","observation_id":"f0bdd02f-48d0-4c82-86ba-4d65edb917a7","resolution":{"observed_at":"2026-08-05T23:32:17.479960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.484812Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.484812Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:7e63d01176c59bd88dc8d1a76e48101e0d49688ab6f282ee86e583878a026195","observation_id":"49472454-c85a-4843-8d08-80e58e3c1e08","resolution":{"observed_at":"2026-08-05T23:32:17.484812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.489327Z","title":"Xiong, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.489327Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:9a2e97c28f03649121081e083e1894c51e797dad21966b2574c3d4424d492078","observation_id":"b64cca6f-fa04-4422-bbd6-4e97073754eb","resolution":{"observed_at":"2026-08-05T23:32:17.489327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.493949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.493949Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:907f892266370ca4423fe82529b6dcc2bba17a9db1847d42cf0c1d0c1018a72f","observation_id":"07245b3a-70d3-41fa-9714-4e67115b95c7","resolution":{"observed_at":"2026-08-05T23:32:17.493949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.500829Z","title":"Chen, Y.-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.500829Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:38f1ca617524f58161161d575e189cb3a7e87e2dc447c4f3629e7b2dcf4ef0df","observation_id":"066bf953-70a3-4a21-b9b4-ef8ba83ced6e","resolution":{"observed_at":"2026-08-05T23:32:17.500829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.505641Z","title":"Zhang, X","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.505641Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b6ecddebcbf5e9cfbac7c9c198e0ca95a630d958c96ca68eca213deafc515789","observation_id":"3e5bc3c0-2e9a-4d2e-b5e2-a760029593be","resolution":{"observed_at":"2026-08-05T23:32:17.505641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.510006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.510006Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:beccbfb4273180161ac971c7d7b74375ac38d49946436ba8c1483a99c634a5db","observation_id":"0d5c2cb1-6af6-4817-8dd1-d749ecdf7b34","resolution":{"observed_at":"2026-08-05T23:32:17.510006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.514435Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.514435Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2cc12bc2c081724f0278b7c148a42a0e35add465eb00976067a296892a7822f7","observation_id":"d7347c27-3b3c-47fa-8d06-1442d2c1b9b8","resolution":{"observed_at":"2026-08-05T23:32:17.514435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.519062Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.519062Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0d53b344a9ac8b00663782a16a01567c97bc96372109f9938d9d112b1ae51ba8","observation_id":"1964705f-3d3e-41aa-b950-c773e4027ee4","resolution":{"observed_at":"2026-08-05T23:32:17.519062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.523349Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.523349Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a610f0f55ba028c1bf4e966564dc72d2ae9c3228824a22461aa8c22b25db6892","observation_id":"358ddc0a-c1fb-498f-8ba1-e81a049dc7bd","resolution":{"observed_at":"2026-08-05T23:32:17.523349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.527721Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.527721Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:e0f139d5499d59c91d548e1104b1c91188a24ba1b1ef35d7a76c5fe911789a0c","observation_id":"1cfede5a-2869-407c-a0a5-f8716337bc1f","resolution":{"observed_at":"2026-08-05T23:32:17.527721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-05T23:32:17.532947Z","title":"Zhang, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.532947Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:608c3953509e5282c6cb9a3f9d951113b44a8677775b77ec59bedcb89c74fd21","observation_id":"65bd9630-41a3-46b9-916e-bed277a27ef1","resolution":{"observed_at":"2026-08-05T23:32:17.532947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.538566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.538566Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:d94acaa3a467840e0f3561e33572637ef84abd01f414094539db786c12933c27","observation_id":"2bcbd8b2-c144-4457-a91c-3df27b2dc296","resolution":{"observed_at":"2026-08-05T23:32:17.538566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:32:17.543808Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.543808Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a0a369f78e786c1e0ac632090cdc34e1377301f107a6f65b4013fcd4eb2eea95","observation_id":"907589c4-ac8a-4711-86b1-82450819d6cd","resolution":{"observed_at":"2026-08-05T23:32:17.543808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.550482Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.550482Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:cb5b1c4f2890f8af8d4f0dc8a98ca76a87030f1ea59918e051efbeb92a54cd08","observation_id":"33dc5993-1d22-4d4d-ad40-f50ad8e7cc77","resolution":{"observed_at":"2026-08-05T23:32:17.550482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.555595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.555595Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:78efe05ba7b88f56c429d586f6f57c79c6a940b2fbae8eedf44ab06d303ccdb2","observation_id":"f3e11a11-382d-4dc5-a13a-9dc3717a4ab0","resolution":{"observed_at":"2026-08-05T23:32:17.555595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-05T23:32:17.561810Z","title":"Cheng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.561810Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:34799734ee1a58a8569628286bd4bd3403bad12d2e5d052706ff2ed61f4f60a8","observation_id":"a2e85720-5584-4f24-bd07-71b9ebab44f8","resolution":{"observed_at":"2026-08-05T23:32:17.561810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-05T23:32:17.566703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.566703Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:830c7d84d327974241b9343a296200c6316ed11a2ccc3d3559387bc5ab039a79","observation_id":"de74602a-762c-4ac9-9b46-cca957b72f45","resolution":{"observed_at":"2026-08-05T23:32:17.566703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.571330Z","title":"Huang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.571330Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b57e7eb45635a9c30e4a629f5986ce09dfc7eeee4c7a683facc70e19e54c676f","observation_id":"44d77a73-e0ac-48f4-822b-474fab802c87","resolution":{"observed_at":"2026-08-05T23:32:17.571330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.576083Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.576083Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2266d2cb5be78aa5299ce541dba0dfd6a532172186ad9be1f06a86ba9eb88aea","observation_id":"c8e0f96d-0b6c-408f-aede-f6307fd30b97","resolution":{"observed_at":"2026-08-05T23:32:17.576083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.580641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.580641Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:97bb4241ad9ac211d2ac5d940aa51318d13a8da7b5ffe11a63f5dee2253c4ffc","observation_id":"d330d962-caea-4a7e-bd1c-fbf39944b073","resolution":{"observed_at":"2026-08-05T23:32:17.580641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.585383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.585383Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:05c30fab4d6e659b76c2914b68b39ce4b1e2702e62ef490c1c576cd418a722b0","observation_id":"21ab5dd0-d1ef-4df7-b288-9b8eb5d86e05","resolution":{"observed_at":"2026-08-05T23:32:17.585383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04388","last_updated":"2025-05-16T08:24:31Z","snapshot_observed_at":"2026-08-19T08:25:31.637068Z","submitted_at":"2024-09-06T16:27:52Z","title":"Question-Answering Dense Video Events","version":5},"cited_work":{"arxiv_id":"2409.04388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04388","snapshot_observed_at":"2026-08-05T23:32:19.419023Z","title":"Question-Answering Dense Video Events","venue":"cs.CV","work_id":"b474f3a4-b69e-466c-b3a5-00156359a356","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.590085Z"},"links":{"cited_paper":"/paper/2409.04388","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:8a13da200eab6fc035230cccf959becd1e32c123ccd37c36d3da17f5ce5c3e40","observation_id":"8094023f-5c7d-4f0c-95cf-a041a5174776","resolution":{"observed_at":"2026-08-05T23:32:19.423928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.594853Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.594853Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:2346274e6129ef1e64e8d93ad8321b1cbd4ea0462e8a911bc79b9e78a61ca5d9","observation_id":"434ed86b-354c-41ac-bbfa-ed746c68d012","resolution":{"observed_at":"2026-08-05T23:32:17.594853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-20T04:16:20.384789Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-05T23:32:17.599520Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.599520Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f0210221cc40652096bf496ddb50606e8bf535cdd4a2bb8a21e0daa340212ee1","observation_id":"989f777a-e959-4819-8ad1-662748ee862c","resolution":{"observed_at":"2026-08-05T23:32:17.599520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.604862Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.604862Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:26fe86146920b58ee6f89326f85b65fef803cc7130ecd8e26bf8c1e8d35cbc0d","observation_id":"a08790b8-dd72-424b-85b7-b1c9ae0dffc5","resolution":{"observed_at":"2026-08-05T23:32:17.604862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-20T04:18:04.894102Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-05T23:32:17.609232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.609232Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:261cb0215a123cf871aa82dabdc310247349f75a7c419baf0db7cb7d0535a07e","observation_id":"5ee27c7d-fb51-4241-8eaf-ef831dfba3f3","resolution":{"observed_at":"2026-08-05T23:32:17.609232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.613707Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.613707Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a7a6c4c7428f63da41d68937f61dd27a292f7de21d28208e5bc875c679cd3739","observation_id":"95e527c9-5938-419e-8dbf-f4abc8847158","resolution":{"observed_at":"2026-08-05T23:32:17.613707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-19T14:14:25.864640Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-05T23:32:17.617742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.617742Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:974efbe5742b508b405260bab593f86c5f3aeab92a96b92331f75557298446d5","observation_id":"ef7c5fcc-0cc6-4ebd-b0cc-dc5daecb2176","resolution":{"observed_at":"2026-08-05T23:32:17.617742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-08-17T13:19:55.906101Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-05T23:32:17.622367Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.622367Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:cd2ebe29bebf37de61793c05607e849c732ace2fdd9c636c38c8d74383fa024d","observation_id":"a1115ff8-dc7e-4c5d-b44e-ff31a2438b41","resolution":{"observed_at":"2026-08-05T23:32:17.622367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.627140Z","title":"Abdar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.627140Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:250e09bb04a45001e25706a1b2c72016df7fdbf795ad216cc93f0bc90f7e86f4","observation_id":"2975d617-022c-4f22-86bf-9aa15455e0a7","resolution":{"observed_at":"2026-08-05T23:32:17.627140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.631444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.631444Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:7ebfac2189b148806a9f6aefab58a17c7eab0947786cd0962e89d2a1ab104a62","observation_id":"846e7eb6-fa64-48a2-b450-500334a692f1","resolution":{"observed_at":"2026-08-05T23:32:17.631444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.635989Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.635989Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:4dda4ddc01d2f8ccdfd4ce198e935b6aebb58bee6b62280a4954264b67449081","observation_id":"d4881420-e7fa-4c70-b3e5-fa63564f43e9","resolution":{"observed_at":"2026-08-05T23:32:17.635989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00234","last_updated":"2021-04-01T03:30:45Z","snapshot_observed_at":"2026-08-16T18:34:36.308315Z","submitted_at":"2021-04-01T03:30:45Z","title":"A Survey on Natural Language Video Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00234","snapshot_observed_at":"2026-08-05T23:32:17.640437Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.640437Z"},"links":{"cited_paper":"/paper/2104.00234","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:088f36c0f1bd35a1d76b90d1bb3c436b1d5f694c39f960d40f7f0a7029767303","observation_id":"014b09cb-8115-4e53-a693-aabaadb268e0","resolution":{"observed_at":"2026-08-05T23:32:17.640437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.645031Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.645031Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:ede925249c4056a1ac1ae33f892af12b0c885c29ead84617b3dd60a9e6b56cfa","observation_id":"21fbba2c-03c7-447c-bdd3-e3ca6c267ddf","resolution":{"observed_at":"2026-08-05T23:32:17.645031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.649595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.649595Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:4b3655d263a42c45c10426b6b9ece7d530c8c2b168746a14e71fd854e813dabb","observation_id":"55320261-df96-4821-9363-464649fb13b0","resolution":{"observed_at":"2026-08-05T23:32:17.649595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.654145Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.654145Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c67230db6b8c44373510526092dd1b11c3424274516895856fc0c33a5041f9ea","observation_id":"8ffb8ef7-7d1a-4ad8-8f33-38b013ebddb5","resolution":{"observed_at":"2026-08-05T23:32:17.654145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.658647Z","title":"Zhang, H","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.658647Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:29b9df3e75577f1a801831549845d50c2651bfeabaf08ae3f05043b37c90faaf","observation_id":"d2d29c30-0c5b-47d8-9ec2-111db965fa1a","resolution":{"observed_at":"2026-08-05T23:32:17.658647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.663025Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.663025Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f3da2483ece8af4a40e723ba928c55fcf40a34d049b95a4239939f7c73b431e4","observation_id":"559c54d0-d5d1-4c3a-8da5-f6fbbc1c6f72","resolution":{"observed_at":"2026-08-05T23:32:17.663025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.667535Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.667535Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:40eda276fa760e7bbd2bb73ee05c30eb3741eb0490be221dd9b7a64fc912e857","observation_id":"a9dbd8d1-b3d8-4adb-be10-5b0c26411e1a","resolution":{"observed_at":"2026-08-05T23:32:17.667535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.672297Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.672297Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:ce0c03210049eba6e3dea69070331760d2abac8f25f502a6995773ca5f4e0839","observation_id":"c93a3c89-3f11-48d1-9b9f-3b732bd20044","resolution":{"observed_at":"2026-08-05T23:32:17.672297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.676303Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.676303Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:e69d0869ae466bd81f30a82eee33495ab6c270d98896fb0a06dcb1084085bd99","observation_id":"471c449e-de1f-4052-98be-129190e86b9a","resolution":{"observed_at":"2026-08-05T23:32:17.676303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.680772Z","title":"Zhang, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.680772Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c4f25042e0ee8139bfb8d6ef8bb210e0ffb83ab3195dacabc1c4bf08ef533977","observation_id":"785bfcf4-c5d7-45b1-b340-75bc7c769e3f","resolution":{"observed_at":"2026-08-05T23:32:17.680772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.684899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.684899Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0d511e3c4acd01762aecb0a165b56c5efcba84dd60684b00251312b6c234548e","observation_id":"f610a675-51b8-4e4d-ba0b-882b260d5c68","resolution":{"observed_at":"2026-08-05T23:32:17.684899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.689927Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.689927Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:51e428ad3b40be9665993b260abd1cffea593781d500314627fba223036c06c4","observation_id":"10c6805a-8eef-4283-ace3-ca14d249584a","resolution":{"observed_at":"2026-08-05T23:32:17.689927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.693951Z","title":"Iashin and E","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.693951Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:39585ccb37ad7eb97bbca3790d253c54749ec31b300675a9de936be3a756871a","observation_id":"544ec9ee-5746-496c-a53c-15a78c722964","resolution":{"observed_at":"2026-08-05T23:32:17.693951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.697949Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.697949Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f0ace6fb191b8b9221ba5ec21600b9a738254ff0784c77d22dbd5a56107ae4d7","observation_id":"4c3be1a9-f883-4e45-9cc1-4acb42f792f8","resolution":{"observed_at":"2026-08-05T23:32:17.697949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-17T01:38:26.232918Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-05T23:32:17.702112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.702112Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:546344e7794b22bf7cf034dc8fb9101b160a02e9e61fa76a4c93f3ecc34f6da5","observation_id":"19e47eb9-e53e-4ef6-b09f-014ff4bff5ee","resolution":{"observed_at":"2026-08-05T23:32:17.702112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.706691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.706691Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:d634163888e5d8f39e564dc3c897c3eea5624525cba55173975b4ba41487c814","observation_id":"eb7c405f-827e-40fe-9f4e-d9a7da9559bd","resolution":{"observed_at":"2026-08-05T23:32:17.706691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.711697Z","title":"Zhang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.711697Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:cf0cbde5210e5dd403ca0d8efabfcce8c09125c8131a573d60900fb266d7d6ac","observation_id":"3d3bdab4-1c93-4a54-b42b-ecc0b7b0bbff","resolution":{"observed_at":"2026-08-05T23:32:17.711697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T23:32:17.716937Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.716937Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f56ee022be000434e007802d59c7f7c9a6c41d0019e9f93e09248a4f43ae51b2","observation_id":"c7011462-3c0d-4498-bc56-d0c1e7897347","resolution":{"observed_at":"2026-08-05T23:32:17.716937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T23:32:17.721674Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.721674Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:3017a4ad8fd3b3bf17a040a9f86d7b77594ef42fc965057b80c357504b619903","observation_id":"03c0c3d3-0db8-4f80-8ec7-9fd97c3db266","resolution":{"observed_at":"2026-08-05T23:32:17.721674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.726831Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.726831Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:501ecd19bf5b8516dbc6846b78f1c9c3b64a4303e34a14169c1d9ce38e4a2193","observation_id":"6b544616-83ca-4226-8f75-51a7f3224619","resolution":{"observed_at":"2026-08-05T23:32:17.726831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T23:32:17.731677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.731677Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:6ea9d840db6a307de65dd1250521606bdab9743ea1fcaaec863ac3f826a88d75","observation_id":"3168c6c6-3f0d-4066-88d2-dc460577a500","resolution":{"observed_at":"2026-08-05T23:32:17.731677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.736248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.736248Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b895e9903e01d711ce9051a7667879ddc75aa5a8b0de488e4d41f5483f4515b0","observation_id":"47c5f693-624f-4adc-99b1-43066b9d9b89","resolution":{"observed_at":"2026-08-05T23:32:17.736248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.740487Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.740487Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:35aa65eeef548374966ddb47757286c9cf3db954f9630594358c6006233d5532","observation_id":"d9769dd9-7495-450c-bd61-cbe0690111c7","resolution":{"observed_at":"2026-08-05T23:32:17.740487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.745075Z","title":"Feichtenhofer, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.745075Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:20584ca152ccbd3e9b65b33b73d18f13cbb54f1609fe64f920c9b1d7f9932428","observation_id":"1d6a3f28-cf46-4f13-be85-7c7b3ff04869","resolution":{"observed_at":"2026-08-05T23:32:17.745075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.750415Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.750415Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:d0de441e36a493b7a4f9e58d4be485535967b52abc3019185117d9b51e5149fe","observation_id":"1eb1a059-d6de-4815-a9a2-f124e60d9c9a","resolution":{"observed_at":"2026-08-05T23:32:17.750415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.755773Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.755773Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f11b2a0866b5dbf208e8bdaa549c36fbeea586b84fc55abfb4100fd94e5037e1","observation_id":"8a9ae72e-bdc2-40b4-b00d-fb97646cdeec","resolution":{"observed_at":"2026-08-05T23:32:17.755773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.760224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.760224Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b4f50bb1f5b5705f5329e6951765a911a3a18c4117452a176de6f19603ac841b","observation_id":"e0f9fe1b-f90e-4d06-9af1-480b6a5ef781","resolution":{"observed_at":"2026-08-05T23:32:17.760224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.765061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.765061Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:ed2c33ff309ffbd007d34d5bbd8f58eaad161d7519355fe6a03096ea74239b85","observation_id":"6d3917f6-fd6a-4437-b08e-e1c464182e5f","resolution":{"observed_at":"2026-08-05T23:32:17.765061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08585","last_updated":"2025-04-24T17:42:16Z","snapshot_observed_at":"2026-08-16T12:51:02.951440Z","submitted_at":"2025-03-11T16:21:23Z","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","version":2},"cited_work":{"arxiv_id":"2503.08585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08585","snapshot_observed_at":"2026-08-05T23:32:19.158465Z","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","venue":"cs.CV","work_id":"16699353-29f7-4268-b473-f73433d6afb4","year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.769503Z"},"links":{"cited_paper":"/paper/2503.08585","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:251555de82178f0bd5b0c59f14988093db186da7628fd5ba411d565cf5b47fbd","observation_id":"aecfe681-e828-44a6-94f9-67d088684a43","resolution":{"observed_at":"2026-08-05T23:32:19.163503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.775218Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.775218Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:0eb3ca442444ce2448fd8897cdec393549d0c10f4bede67d7c93c907dfe4b0c3","observation_id":"90b69520-e057-43d9-8cc0-42c77af96758","resolution":{"observed_at":"2026-08-05T23:32:17.775218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.780085Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.780085Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:fa3139734b718691806ad62168003e874b5748be3afaf13d8dca439d05cbf8c0","observation_id":"e5f12779-6a3e-4707-ad9e-4d98c238e7a1","resolution":{"observed_at":"2026-08-05T23:32:17.780085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T23:32:17.785286Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.785286Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:3a46e7c96a6ce532a095bc1340c89d34e2c811790bf7645ccdecdb0f0ab7cda6","observation_id":"af7cf594-9292-4f89-8d3e-4663faab3b93","resolution":{"observed_at":"2026-08-05T23:32:17.785286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.789902Z","title":"Huang, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.789902Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c9b0e5199b205de17de20347ee2dc2c4a72a6364fffeedb1838b824c76adf3ff","observation_id":"795bc96e-a601-40d7-982a-70f0bc170e33","resolution":{"observed_at":"2026-08-05T23:32:17.789902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.794850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.794850Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:8ea8bad054424dcd0a10b83ea95c526c6a49140b80ab754dbe6930ef9e9fb7cd","observation_id":"9c32c71b-70ce-46b2-b471-906b0464179a","resolution":{"observed_at":"2026-08-05T23:32:17.794850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T23:32:17.799225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.799225Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a875d110291d3782fa932312f2e53893c61389e6528b4e2a4f0c19399276a37d","observation_id":"8d9f69a4-1136-4732-8936-b794417cb6bd","resolution":{"observed_at":"2026-08-05T23:32:17.799225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-05T23:32:17.804125Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.804125Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:3492facecd89404abacfe70d26be9a23732a404297704c606f8177358ecc5310","observation_id":"1949ae06-50bd-4c89-a926-48883de00917","resolution":{"observed_at":"2026-08-05T23:32:17.804125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-18T10:32:35.062948Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-05T23:32:17.808793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.808793Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:d0648c598c5bcee49bb832ece58e99c5adc962cd675be70652a6cd06e012a8da","observation_id":"865f3073-7922-4280-8fb8-51adb5bb41d0","resolution":{"observed_at":"2026-08-05T23:32:17.808793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01328","last_updated":"2025-04-02T03:24:58Z","snapshot_observed_at":"2026-08-19T09:36:03.934983Z","submitted_at":"2025-04-02T03:24:58Z","title":"Slow-Fast Architecture for Video Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01328","snapshot_observed_at":"2026-08-05T23:32:17.814422Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.814422Z"},"links":{"cited_paper":"/paper/2504.01328","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:da7e59ec9fbb08b2c78a2b1c84588a7b3903fdeb11cf6b5ec1e1a6768070de51","observation_id":"89728ef8-fc4a-4e38-ae24-691b01dab7f8","resolution":{"observed_at":"2026-08-05T23:32:17.814422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.819028Z","title":"Miech, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.819028Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:d615fe7b6039ae0fc65ff0f75a4e8b0606c64e738d253e7dcf0bfc455973be45","observation_id":"819149ec-2a90-4398-bce9-4c9b07ecff66","resolution":{"observed_at":"2026-08-05T23:32:17.819028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.823530Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.823530Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:bdbaa4d6bec7834d064c0d4605907e8da93076f73033ec94ede2172b5050344e","observation_id":"d9c08757-20ed-4c5c-bfb7-01ad525618cd","resolution":{"observed_at":"2026-08-05T23:32:17.823530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.827672Z","title":"Schuhmann, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.827672Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:16c86165a879bcdbd6608950de5ce40534093bd1afd396aaf2cb37fbe21a25f8","observation_id":"f1de355d-a83b-4b4c-98ec-849371a1a58c","resolution":{"observed_at":"2026-08-05T23:32:17.827672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-17T03:02:06.550157Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-05T23:32:17.831964Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.831964Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c69d13ab3c3d763ebb5565234299c2373df39c7c4a249a5485f24d5e0befcc93","observation_id":"4d0bd7e3-10c6-4259-acb1-704fa9e30622","resolution":{"observed_at":"2026-08-05T23:32:17.831964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.836944Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.836944Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:09a6140d844fd78de62f4d49c4b82795d20b6408b179cd18ab800ebbf01f6546","observation_id":"f1561613-df99-4fd2-96ae-a26e9ea1434e","resolution":{"observed_at":"2026-08-05T23:32:17.836944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.842203Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.842203Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:6847f26c1b93dccd729b0ed401cc419ed9961025dd4bad181ea11a63f53f2371","observation_id":"bbd18ff9-bd60-41e7-8f7d-00d4155bd2e8","resolution":{"observed_at":"2026-08-05T23:32:17.842203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.846474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.846474Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:bb2cf85acf8cb5751664bd19eb3a83269bf06554d6e6085caa165b846ab324ec","observation_id":"cde0115a-451a-46d7-9c81-bc72ae14062d","resolution":{"observed_at":"2026-08-05T23:32:17.846474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-20T05:08:08.234059Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:32:17.850843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.850843Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:5cdc962ad58029001fc79d9d8f4f74f3921017b9ddab81a701b551d6fba1e933","observation_id":"45f422a6-bf94-4aba-a52a-2f60719e77aa","resolution":{"observed_at":"2026-08-05T23:32:17.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.855145Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.855145Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f6bcdc47957addb9a7c6ac9e6700c6aa4d632e4f4f108116a986491bee4be2d1","observation_id":"0db8b3c9-30bd-480e-a287-ede2fcbd48a3","resolution":{"observed_at":"2026-08-05T23:32:17.855145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.859811Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.859811Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:db515c5f953de2fba9d31d93d88579a6d1dce0946f6400e6b6a042be558c2939","observation_id":"8aff295d-f45c-49bf-8711-5fbe9bc37e66","resolution":{"observed_at":"2026-08-05T23:32:17.859811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.864113Z","title":"Liu, C.-Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.864113Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:14ecca41fbbc3fcc9f367e9f002cb9c211d9cb9e98f78cfee19750b887a36a17","observation_id":"90112b56-42bf-4d27-b410-da5d77c56cbe","resolution":{"observed_at":"2026-08-05T23:32:17.864113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17880","last_updated":"2024-06-25T18:39:43Z","snapshot_observed_at":"2026-08-16T13:39:39.209560Z","submitted_at":"2024-06-25T18:39:43Z","title":"MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2406.17880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17880","snapshot_observed_at":"2026-08-05T23:32:19.025300Z","title":"MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval","venue":"cs.CV","work_id":"c5aed71e-dde9-44ae-835c-49d84d9e15b7","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.868571Z"},"links":{"cited_paper":"/paper/2406.17880","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:75d98ea7cce9c503a5f510c7944c2396f8cfbcdb7d72587479411ec71b1293ed","observation_id":"7ffdd6e3-785b-4995-a9af-7dd2950cb6fb","resolution":{"observed_at":"2026-08-05T23:32:19.030539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.873383Z","title":"Di and W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.873383Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:037b7a8000e8140fc632bf9887fe526be6d91fccb14877748907bca7a86d34b3","observation_id":"40ef3941-45ca-4495-967b-b3e6ee5cf6a0","resolution":{"observed_at":"2026-08-05T23:32:17.873383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.878426Z","title":"Zheng, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.878426Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:c6e21fd0693066626b59c91235aa6c54447898d6a61319bad3c49e83a3fc539d","observation_id":"156dfd67-c440-4efa-851d-09709eb8606e","resolution":{"observed_at":"2026-08-05T23:32:17.878426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17117","last_updated":"2023-12-28T16:54:21Z","snapshot_observed_at":"2026-08-16T14:31:08.211823Z","submitted_at":"2023-12-28T16:54:21Z","title":"Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17117","snapshot_observed_at":"2026-08-05T23:32:17.882834Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.882834Z"},"links":{"cited_paper":"/paper/2312.17117","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:f27a47e91d4638e7f5afd8c63d6cf329ea22f484fc73fd1d653d52d06f4f35a0","observation_id":"5ddbcca4-14eb-4c7a-b53e-c010ce2d2124","resolution":{"observed_at":"2026-08-05T23:32:17.882834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.887713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.887713Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:1f4628fccd956d7376ff6bf8a8f2516ea8489c05a603a71e174134ef1b4a0436","observation_id":"52300739-7cee-474e-977b-5d4e9eb60b6b","resolution":{"observed_at":"2026-08-05T23:32:17.887713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08593","last_updated":"2024-10-11T07:42:36Z","snapshot_observed_at":"2026-08-16T13:10:25.942615Z","submitted_at":"2024-10-11T07:42:36Z","title":"VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding","version":1},"cited_work":{"arxiv_id":"2410.08593","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08593","snapshot_observed_at":"2026-08-05T23:32:18.989072Z","title":"VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding","venue":"cs.CV","work_id":"16620f30-bd35-4fa6-b65d-32dd44585778","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.891994Z"},"links":{"cited_paper":"/paper/2410.08593","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:5c1b039533991b82414235540fee1fce981060e0731c4fec7647ca40a607750a","observation_id":"96585e33-88e0-4671-a87b-258ad57956e1","resolution":{"observed_at":"2026-08-05T23:32:18.994201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02336","last_updated":"2024-08-06T04:04:23Z","snapshot_observed_at":"2026-08-16T13:28:32.924404Z","submitted_at":"2024-08-05T09:19:52Z","title":"Infusing Environmental Captions for Long-Form Video Language Grounding","version":2},"cited_work":{"arxiv_id":"2408.02336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02336","snapshot_observed_at":"2026-08-05T23:32:18.965749Z","title":"Infusing Environmental Captions for Long-Form Video Language Grounding","venue":"cs.CV","work_id":"ec411b1b-5845-42f9-8447-a7edb4fbfe13","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.896758Z"},"links":{"cited_paper":"/paper/2408.02336","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a664d86cb8ef1705007d91e3f5533ddd05cc3e048c9de5ffa5eda968bfced9af","observation_id":"20f51e9d-5358-4905-ac83-e8e182b11593","resolution":{"observed_at":"2026-08-05T23:32:18.972288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.901602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.901602Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:3906dd5b441a8da027d84c5e41879bf45cc764d2f0c0421a54c9fb91f3d23047","observation_id":"b960ac46-3284-4199-99bf-247be9d6cc91","resolution":{"observed_at":"2026-08-05T23:32:17.901602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:32:17.906296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.906296Z"},"links":{"citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:4d66aa5ce49bee5017198e080d5bf7d99287ed8c2dc6817e4a38e658ea64e933","observation_id":"73d51dbf-dc62-48a4-9c7e-12dc4c4c26af","resolution":{"observed_at":"2026-08-05T23:32:17.906296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12540","last_updated":"2024-05-21T07:12:27Z","snapshot_observed_at":"2026-08-19T01:09:02.535941Z","submitted_at":"2024-05-21T07:12:27Z","title":"Context-Enhanced Video Moment Retrieval with Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.12540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12540","snapshot_observed_at":"2026-08-05T23:32:18.875089Z","title":"Context-Enhanced Video Moment Retrieval with Large Language Models","venue":"cs.CV","work_id":"0cf89c0e-a92a-411c-b63a-c3a06f6ea730","year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.911414Z"},"links":{"cited_paper":"/paper/2405.12540","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:b90a21079b17199722ffec657252d5bf421b90f0cfa008386ec11ff917324f55","observation_id":"a55f8afc-6794-49d6-b2e8-f7c444f1765a","resolution":{"observed_at":"2026-08-05T23:32:18.882066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":164},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 164 outbound references and 3 inbound Pith citation observations for arXiv:2508.10922."}