{"as_of":"2026-08-07T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1f6c5bc1f4d15ff9d5356441ef2e165fb983177e0e89f741c47d0740fd9bc1b","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:30:37.955324Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T19:27:29.843866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:06:08.881592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":"2508.01699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01699","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b9e2227-9cac-4582-9077-538f60775f15","year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T12:45:50.422679Z"},"links":{"cited_paper":"/paper/2508.01699","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:8993a5cb4551889e993afa3fc3ca77445fd0e933391b72b72d1e87fec6823983","observation_id":"8ca6f62c-11c8-46a6-8623-e65dd0c21a46","resolution":{"observed_at":"2026-05-11T19:06:08.883921Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01699","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2508.01699","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:ef8366537c96514ef317fd3960953b6d92d4d3ff0c0e4a00e0131c20a8bf0343","observation_id":"a4663677-3956-4d70-991c-cadd2285c595","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.01699/citation-record","integrity":"/paper/2508.01699/integrity","json":"/paper/2508.01699/citation-record.json","paper":"/paper/2508.01699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.998764Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"d6e8000a-795b-419d-9c1a-34b0182fe4a0","year":2005},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.412600Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:98a4f2781f0b6cc77e5900736b6c8cd6cba29b8e3bdd70bb5baa6c5490504450","observation_id":"623f6c64-f604-4f32-8938-a8446102c4c8","resolution":{"observed_at":"2026-08-06T05:30:44.003791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.982730Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5a147550-c184-4a21-bbfb-45c93eaca1bf","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.531809Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:96de633445a3b2e520ec792e777196a58723ee3520c75d3189fa128715ed55d6","observation_id":"05c00db8-871c-4775-a3a2-3c3ce4dec1b0","resolution":{"observed_at":"2026-08-06T05:30:43.987971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.966082Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":"ecaf1e8c-fa19-46e1-8de9-085548f01ac4","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.609028Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ad21d369cde3e2408c3e1466315a14d5dd234b337e7dff289023626c66c19ea7","observation_id":"c78fdb2e-00a1-4b18-bd51-4781f388e678","resolution":{"observed_at":"2026-08-06T05:30:43.971860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.949183Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"ed497ac2-96f7-413c-9106-f54d9c1c31ed","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.692548Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:8ede789ec01a624f4ed0c71b23597d7edecff87a0f2093360b2de508ea376181","observation_id":"d594ea80-d3fa-48c4-b294-be2a229abc9a","resolution":{"observed_at":"2026-08-06T05:30:43.954786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T05:30:33.778727Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.778727Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:fbc4f4b854175d0b6c8458446b9a2d1625c6930707479a1f29c053133ef79dcf","observation_id":"3ef79b53-06a9-4b21-9f6c-85d5dd158b02","resolution":{"observed_at":"2026-08-06T05:30:33.778727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.932929Z","title":"Uni- fied scaling laws for routed language models","venue":null,"work_id":"36b44b0e-7b9b-4ce6-87b4-031c01a97f1c","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.858259Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:8b408252011c86efdbe42d2efae1ec04fca24a977d77112770a82f62afde67d4","observation_id":"b9a04bde-8af6-4c7d-b103-ceec727b8e87","resolution":{"observed_at":"2026-08-06T05:30:43.938058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.916439Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"a50399bd-d20b-4f4d-8464-18164dfec56b","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.901509Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:4d109cb011b8e01f6605226ce9dc606cfd9c5815d759dc4bb97620781e518ecb","observation_id":"1a072bc1-35a1-4940-a54e-7d53b065ba84","resolution":{"observed_at":"2026-08-06T05:30:43.921880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4314","last_updated":"2014-03-09T20:15:03Z","snapshot_observed_at":"2026-07-06T03:30:57.897408Z","submitted_at":"2013-12-16T11:15:10Z","title":"Learning Factored Representations in a Deep Mixture of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4314","snapshot_observed_at":"2026-08-06T05:30:33.960108Z","title":"Learning factored representations in a deep mixture of ex- perts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.960108Z"},"links":{"cited_paper":"/paper/1312.4314","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:297468f9b43fa899e4520f641430ccb862d5f29510879e423abbb19120a51d1a","observation_id":"f6ea2427-d8b2-44f8-9eec-6ee7fca202fc","resolution":{"observed_at":"2026-08-06T05:30:33.960108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.900369Z","title":"To- wards an empirical understanding of moe design choices","venue":null,"work_id":"33c969ec-9ae7-4823-9ce8-02238d707f5a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.049822Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:38820e903fd3b4dbe90aa96e98e4c9332f7f7db22cecd81352f2b46687f830ab","observation_id":"c0c05667-94c4-484c-95d8-f322f64d16cc","resolution":{"observed_at":"2026-08-06T05:30:43.905539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.883553Z","title":"Switch transformers: Scaling to trillion parameter models with sim- ple and efficient sparsity","venue":null,"work_id":"66de8aed-cb2b-4ada-ab98-f80bb2a5ac81","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.155000Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b23cf9c7dd882825dc85498748976dd3cf2497492e6404583e01946f7c8a7e15","observation_id":"157887cb-5000-4b81-8b97-0f9409a752e7","resolution":{"observed_at":"2026-08-06T05:30:43.890185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.866997Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"5e5ce235-06f7-4004-8ed1-4473fa69f292","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.195738Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:dcb42ad54cc4b0e48f30c351f4437b21111e387492492d81f87df1f87adc5fbd","observation_id":"1113bebe-bf15-4fd8-894d-e77ba17abd5c","resolution":{"observed_at":"2026-08-06T05:30:43.872370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.851184Z","title":"Soda: Story oriented dense video captioning evaluation framework","venue":null,"work_id":"142d9996-da2a-4dcc-8105-3c3d32266903","year":2020},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.229575Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:8e5db6f6c7d560d569d183e8b33dabd8b78033189e17a0183c74cbf5f76295e2","observation_id":"3df24c47-2fca-46c6-abe5-2bc47edf56da","resolution":{"observed_at":"2026-08-06T05:30:43.856269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.834528Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"e7911e39-9568-413d-854d-ea3fcf580800","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.278365Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:da9191d232ce3d7f29fc08b31de2a6567cd84eb7f37c2f814a2880a1b2257a67","observation_id":"605203f0-9526-4c6f-9f37-717c149fb719","resolution":{"observed_at":"2026-08-06T05:30:43.840107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.816274Z","title":"Dynamic mixture of experts: An auto- tuning approach for efficient transformer models","venue":null,"work_id":"2c01df65-80d3-4188-993c-526fbdef64c6","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.391428Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f75b05582bf0e64cb50af9c94d860a8be2cb785d6c99519b7a4c0c89e1a2c1c7","observation_id":"093ce128-28cb-4f61-8c89-8d03aad676a0","resolution":{"observed_at":"2026-08-06T05:30:43.821904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.798941Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":"035bec78-5d75-4a78-b6e1-5c41c00b094f","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.460788Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3294949999fa63d9001d6883b29c5a76a50ab6abe21c7d4aae48ee093e36353a","observation_id":"6889abd9-af84-4ed9-bb06-8b189a4ebf88","resolution":{"observed_at":"2026-08-06T05:30:43.804342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.781206Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"27a1bb6c-2276-4425-91cb-efcd6e4f338c","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.482059Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5fc4ef799dac6c62230c8873755a01d20bcccfc700cf1ce79be0d9c1ac9ece45","observation_id":"a1f15d89-1ff6-4c8b-871f-0de6772c6963","resolution":{"observed_at":"2026-08-06T05:30:43.787199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.763980Z","title":"Creating summaries from user videos","venue":null,"work_id":"9c9a5e7f-0616-4470-8d24-5ca8887039da","year":2014},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.561469Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:68f8b3cc98c295f2a103f82cd9d7e9ae0315dc74826b1665efc6223b383c1f74","observation_id":"131fdcac-9151-4a86-b262-05f56902c143","resolution":{"observed_at":"2026-08-06T05:30:43.770016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.746720Z","title":"Unleash the potential of clip for video highlight detection","venue":null,"work_id":"06c06dc8-663b-48a1-97cc-625ebc49fa36","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.659566Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:e84031dbbce3ffe7cb97e86a5903fb3a0a7c60e8b792200bbdd09d8a13b884a1","observation_id":"17d0bea3-7751-402c-b7f0-41c96bcaaf06","resolution":{"observed_at":"2026-08-06T05:30:43.753155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.728941Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"b29e90ca-055c-4c65-b27c-31842d08a52a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.719234Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:fd7578b880ade196f51f314b72fa42926d036e54996ac27ce45c3319d0008ece","observation_id":"eb98ddcc-bbff-493f-8710-4580b8875508","resolution":{"observed_at":"2026-08-06T05:30:43.735002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.712739Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"e72f1051-7245-425b-b1b6-d4b5fffd3cf1","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.745891Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:07784c60baebe2c3eac23e21798770214330a5cc0bb289a3ffec6352d98d1897","observation_id":"2f14ab98-16ba-440c-ac4c-2eae1cc543bd","resolution":{"observed_at":"2026-08-06T05:30:43.717956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.695735Z","title":"Harder tasks need more experts: Dynamic routing in moe models","venue":null,"work_id":"93b941bd-b4d6-4346-bbaf-26a437029bbe","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.788888Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f5146aa4ab6d079ff084c90138a947f7ba009905146458edc9a5edc6db0965e9","observation_id":"ea59856b-3465-421e-893d-13195462547c","resolution":{"observed_at":"2026-08-06T05:30:43.700576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.678877Z","title":"Do you remember? dense video captioning with cross-modal memory retrieval","venue":null,"work_id":"65fe7ab7-3f11-4ffa-a0eb-318ca7c318fe","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.845670Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d7164eb897541eb9e0e02ee91163179aa195fa6a10c563afe837858923baaa4c","observation_id":"2b6eb25a-64d9-42c0-b027-0f29de08ed76","resolution":{"observed_at":"2026-08-06T05:30:43.684117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.660258Z","title":"Dense-captioning events in videos","venue":null,"work_id":"17a0c723-043f-43d8-a02b-6c51da7d308c","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.928179Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:cce3d4e19b278f074bb7b9cf994bb25205208a90e08af792293d730c55f45898","observation_id":"087627ca-d238-4b66-b779-31be644de0bd","resolution":{"observed_at":"2026-08-06T05:30:43.666589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.643798Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"423b4ac5-f5d1-41ff-853a-6192e0d1a1cb","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.980675Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:06c9ec35fdcf7a33fbf1454a8f41424a3a5ff6e75a9976ce690a51c3992bcafd","observation_id":"0d490c18-b50d-4187-83f2-910cd91a7aa5","resolution":{"observed_at":"2026-08-06T05:30:43.649257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:30:35.065340Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.065340Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:50f13b9fac364d3a8735291850aaa01a86921735f9b70e22831e4f2729227788","observation_id":"25639214-899c-434e-956e-1357c905573c","resolution":{"observed_at":"2026-08-06T05:30:35.065340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.626831Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"dbefe6b2-b13b-4c1c-9d6d-1db1202bf93e","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.126090Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b7de495a5d5dfa2fbe6bc0f61fd00ff4f511bb11e40fea28f93842ae579e2f53","observation_id":"f1aa857f-33c9-40a7-b022-50c49599aa1f","resolution":{"observed_at":"2026-08-06T05:30:43.632430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.610095Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"9c376a64-f66d-4dcb-81ff-bd812cf3654a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.192935Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:c8a7b83b4d774d0f7b9dd2d9a12fdfdeb48510d734527e2b1e8835c97dc21a59","observation_id":"17249dd6-7a2b-4b77-bdc5-01035a740a7d","resolution":{"observed_at":"2026-08-06T05:30:43.616051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.594506Z","title":"Uni- moe: Scaling unified multimodal llms with mixture of ex- perts","venue":null,"work_id":"afd95002-ac3f-4b69-b232-d647cefad8da","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.268512Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7bd30d2b0d8bdd16445206dcb131e0d9c380d9840e404cd55f3984fa2b41789b","observation_id":"38d5f266-c7c9-4f71-a086-1d79f9b2507a","resolution":{"observed_at":"2026-08-06T05:30:43.599390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.578009Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"8c24ceda-13bb-43ed-84e4-4718c90ad5bc","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.379944Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3f58fd5c1449246f6fa29a39d7d3532e3278e0fa01a9142cccb49930a76cc4fb","observation_id":"0bf732be-fc47-43d5-94dc-a48d507c7e89","resolution":{"observed_at":"2026-08-06T05:30:43.583338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.355783Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"b522db6b-2770-428d-a9d5-45ed0b1438b6","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.452520Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:6208015ddaecf669f6abdd993f1cf5f8168046d33f7a9e27d00261b0a22c0133","observation_id":"74721bab-b9d3-4406-83fb-14975db5b8d5","resolution":{"observed_at":"2026-08-06T05:30:43.566814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.189150Z","title":"Visual instruction tuning","venue":null,"work_id":"15382f2a-c537-41e7-ad72-b98338527074","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.516888Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3f9a232c1161668ddb8567365490c4ebc799032783f05777912ed1a3014c2f8e","observation_id":"3919a88f-713a-407b-b5e3-5031f14b8e5e","resolution":{"observed_at":"2026-08-06T05:30:43.270070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.049767Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"32cfd00b-aae5-4f96-bab7-474d1e09535e","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.562812Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:2e24dc75c2608559e630151602b95b40e4484c3226d97e20f3730a650f6de62f","observation_id":"6fa5e354-bf29-4290-84af-8d37a5a3f3be","resolution":{"observed_at":"2026-08-06T05:30:43.095980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T05:30:35.652829Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.652829Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0e820ce463001f52285f447177a04e0e9315e62bc779318ad9dfb78de0a78bab","observation_id":"f21d3b11-8dd8-4f2a-8183-1df5bf4165df","resolution":{"observed_at":"2026-08-06T05:30:35.652829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.870991Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"d3e2755a-a35c-45c3-8827-5f174c2c8ce5","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.721302Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:a4263b1ce6abdd8db6ffb8a321ae0d325a670dffa90120909a01e7831985a0b1","observation_id":"4f7a096b-b4d3-44bb-8fae-6767e6fa3049","resolution":{"observed_at":"2026-08-06T05:30:42.962184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-04T18:08:42.450729Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-06T05:30:35.805762Z","title":"Correlation-guided query-dependency calibra- tion for video temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.805762Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:38ef410bc406cf09fcf7fc57f021078201f872a9088d5ca11e1f9a019b56583b","observation_id":"aad3652a-5708-4e5d-8c17-6efe370f64ca","resolution":{"observed_at":"2026-08-06T05:30:35.805762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.737222Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"20b3244e-b4f7-4a95-a3c5-1cd2a3e59016","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.859524Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:1ea42b7088100ae39a9208009b6cbf87373f11b73e3a898f2732c3f0f01ad9a6","observation_id":"946c2b1c-897d-422a-a44e-bf2b23a11a99","resolution":{"observed_at":"2026-08-06T05:30:42.861021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.517050Z","title":"En- coding and controlling global semantics for long-form video question answering","venue":null,"work_id":"7430ec1a-d6c4-46f6-aa0c-4dd32d9ec126","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.945738Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b0087bf8de5ae172d43deca891ba29e02ed077e11b3755916ba205cb7f30c4e5","observation_id":"951b66dd-ded4-46e1-b914-0e7ae09582af","resolution":{"observed_at":"2026-08-06T05:30:42.691002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.179840Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":"5f9f0361-b733-4785-94a3-478e6e27954d","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.024923Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:bf1eb6ee6452ce4bdc3c62e3daed61ee16b185bb5df8d1359f2f2106d4c932cc","observation_id":"5d933afe-c99b-4224-ba99-330958abac2c","resolution":{"observed_at":"2026-08-06T05:30:42.342649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.010615Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"56a7bbeb-003c-4617-b6e3-64f7506e1770","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.097163Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7c28f38863fb5fb305a783afe455c2aba04bc202347aa4f0a592fdea21fc9704","observation_id":"d99fb04b-5f3b-4521-9298-0da608427cec","resolution":{"observed_at":"2026-08-06T05:30:42.092397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.826200Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"c8c3ce2e-1270-4cfa-af60-53afa0b7a9de","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.191091Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d0a7064399122ed0be4002366de3879175abeb8d13621f8455ccf76bb006f346","observation_id":"5147b790-31ef-4d86-aa40-411c7b036680","resolution":{"observed_at":"2026-08-06T05:30:41.922959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.632680Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":"67d277d8-21f6-4dea-8108-c992873ffb0f","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.236316Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:fc0eec8e7201ecf8302cf07a1adda2282c3756827ca4a4968dd5a50906f585e4","observation_id":"d5300c57-1ae8-49f0-8ef3-53426d8d5c33","resolution":{"observed_at":"2026-08-06T05:30:41.737786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.442129Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"ee9a40b1-4eed-463e-9083-7e29c0832e72","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.311506Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:99cc28da74b37283760428a5ec58ae844762d02a3461ea8fb56ff904f4c18700","observation_id":"e0ed41b6-1d91-4256-9b4f-85882b0e8c6e","resolution":{"observed_at":"2026-08-06T05:30:41.545662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.246987Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"e4738ed4-2319-46b7-9dc2-1e8b39ab1e5f","year":2019},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.406795Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:71d1452fba31ae7e226f83df07578cab25bb17eadd9c672ac7a03cc56a74b4da","observation_id":"fe940160-b914-400f-ab09-e401a411b2b2","resolution":{"observed_at":"2026-08-06T05:30:41.321973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.065701Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"2d203e19-5393-4005-9169-f4a5d83aaa5a","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.468685Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:74667988066938193c4005ca4cc59c9c1ca569388ee6823846ecc6071b2bb07f","observation_id":"b25f3dc0-f091-4f80-a22d-fb0b32701f85","resolution":{"observed_at":"2026-08-06T05:30:41.139740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:30:36.525254Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.525254Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5a029acf08c32d92b93004feb741592d17c7bf0dd8eb7a85fd95f4112155774f","observation_id":"cb8d8afd-6d9a-4832-a6ef-ffdc5fd7d998","resolution":{"observed_at":"2026-08-06T05:30:36.525254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:30:36.592742Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.592742Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:4ac3628d1fe994cc23983fa3394c783901a5fccbb5e7b5f6f2b3b24ed0f87605","observation_id":"93fa13a4-7f4b-47c4-a171-aad8de3a708e","resolution":{"observed_at":"2026-08-06T05:30:36.592742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.861808Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"c77a2d9b-6dbd-48ff-ba78-af64c86528e2","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.628329Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:6ee62cb9bfa82ff6d5b315e722b9209e6c047616e95779a66ee13a94b32da123","observation_id":"d2919905-838c-4982-8446-f1457ca57e9c","resolution":{"observed_at":"2026-08-06T05:30:40.943395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T05:30:36.666749Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.666749Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:1afb162bc4dcfdcb9a4c7e73e2a64c67786101b0754f88a7355a6bce12d5a6e4","observation_id":"d3969c71-fd3e-4fd9-a942-9c16d6e17c84","resolution":{"observed_at":"2026-08-06T05:30:36.666749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-06T05:30:36.705649Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.705649Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:601314fa9eef6dee61e30a0cc2d18f546a803e630092407e85e43e2078627031","observation_id":"87fcc106-ab07-4f0a-8792-1a6c1b708276","resolution":{"observed_at":"2026-08-06T05:30:36.705649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.668103Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":"da7235c9-e536-4364-982e-84e22b399e05","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.758678Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d119a7b6a61c97bbcb1d15ac54118e5cefca8519ec231344f35c64c58d862708","observation_id":"b558d7db-a77f-49b3-bc16-66330f50fb08","resolution":{"observed_at":"2026-08-06T05:30:40.747026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.493705Z","title":"A large cross- modal video retrieval dataset with reading comprehension","venue":null,"work_id":"7dd4da6c-06fc-46a4-b5df-b03797bfa668","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.832418Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ce458f1af22a9d7a634397ac3959fe3c286d6974473b203ff5ea44ee76bca21a","observation_id":"3726fe4c-6468-4c6f-bd24-70914bd28998","resolution":{"observed_at":"2026-08-06T05:30:40.563938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.319893Z","title":"Multi-head mixture-of-experts","venue":null,"work_id":"3178c8c5-6e5e-4cbf-9270-d582e296cc9a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.911944Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:e33e5b6d406939aec6951c48b1e5b9ebf7a24f8ef286a25f8d5d7fd49ee34d78","observation_id":"63d58ae2-fa10-454f-98de-3299a0f51c49","resolution":{"observed_at":"2026-08-06T05:30:40.392301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.157407Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"97cf8e56-ae28-4176-a356-fac19a9faf8d","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.976754Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:9f6d1d204ed4cc78426382ce53e05d7cebb05c061ace67a82ab2d42e3f9e65ca","observation_id":"4c366bce-39e4-4cd0-8593-0e30cda2ded0","resolution":{"observed_at":"2026-08-06T05:30:40.224920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.905207Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"57bbf09e-b4f2-45c1-82d2-179ec6023035","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.021922Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3584b4260670d53b2a65ab49e0d33869d805a55e0f99e10745b8aadeec334bcc","observation_id":"ba09c676-ddfd-4cd9-a31b-72a8c20d5874","resolution":{"observed_at":"2026-08-06T05:30:40.028153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T05:30:37.087279Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.087279Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:804483aeaa593b6b04f56aacbe92a8aec3a64dd8ebf66285c5ac824da359ed0c","observation_id":"7af50d6b-ec72-4721-b2f1-72a2dbe5712b","resolution":{"observed_at":"2026-08-06T05:30:37.087279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.15082","last_updated":"2021-08-09T15:33:59Z","snapshot_observed_at":"2026-08-02T18:00:42.430439Z","submitted_at":"2021-05-31T16:12:44Z","title":"M6-T: Exploring Sparse Expert Models and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.15082","snapshot_observed_at":"2026-08-06T05:30:37.167043Z","title":"M6-t: Exploring sparse expert models and beyond","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.167043Z"},"links":{"cited_paper":"/paper/2105.15082","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b35ee14887ae1e831acca376a74e8777ea0bd9812dca5d6c0e53f62a01fb7797","observation_id":"ea7a8c66-e388-4263-897b-46e884175c77","resolution":{"observed_at":"2026-08-06T05:30:37.167043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.643624Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"16a502d3-ddf8-49f7-928f-a7797180f10f","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.242864Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d5d477bf21c081499d3b954335d076b0891d764de08dd7ee06b81ee04cd65076","observation_id":"851e325b-d961-44ab-8b75-d640d8e482e4","resolution":{"observed_at":"2026-08-06T05:30:39.774822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.374642Z","title":"Xmoe: Sparse models with fine-grained and adaptive expert selection","venue":null,"work_id":"63823d59-95f3-44f2-baab-617dd5674829","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.309509Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0979dcd95074e381c436f466933a548a461f97dfa0ed8914285291acb3cdbd0e","observation_id":"5a8dcb2a-b125-4ab5-81b9-631efe2ed276","resolution":{"observed_at":"2026-08-06T05:30:39.469525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.183763Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"4609f792-d543-4f66-9a59-58ffcd898eba","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.434673Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b3e1679198be191d5c51e9b3928c26d41ddf695c8de8318b144f41f5bb33646b","observation_id":"e3580b97-3d5a-4a1a-8e90-e0f4f2709d2b","resolution":{"observed_at":"2026-08-06T05:30:39.278032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.018889Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection","venue":null,"work_id":"9a034a43-5560-4c1b-a1ca-052783c68b5c","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.530612Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0b585966e314b529254e54c29bbd35d5e8d5e3d36570196fd4d0d55e97279252","observation_id":"4aaf3c91-7ccc-49bc-a41f-3d144cf8a627","resolution":{"observed_at":"2026-08-06T05:30:39.112892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.766650Z","title":"Adamoe: Token-adaptive routing with null ex- perts for mixture-of-experts language models","venue":null,"work_id":"6b11c4cf-250a-4395-b9c2-9bd6154cc9b1","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.591682Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:728a69adc159ebd422fd06181075966e277ea221a3b2f30aaca9e7985bd71df0","observation_id":"446f505a-9a3c-48ad-b300-2ea55a96d67f","resolution":{"observed_at":"2026-08-06T05:30:38.881163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.527694Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f96ae029-7b87-466d-80cb-5d6133fbb7c7","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.662646Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f00ebb85976feab84876067c75b0db7203eea821fd41784791d80160d0895463","observation_id":"40fedbaa-ed58-438a-ac61-d11118b75316","resolution":{"observed_at":"2026-08-06T05:30:38.619902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T05:30:37.791480Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.791480Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:181cec8e3723a84809f535b15354742d3b911629542b255f08fd3d21bf2ae586","observation_id":"fc61fe64-0088-4c2f-b95f-349400158007","resolution":{"observed_at":"2026-08-06T05:30:37.791480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.298446Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"1729f2fe-7de3-4797-a8a2-1e5f0d74aca1","year":2018},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.874247Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:e7e1e2a5c2df3dbc54f50b51b1ace787c1c92cf36c15eea5a5be4214a4d95456","observation_id":"01d9109f-96a0-482e-a24e-52e57a29f998","resolution":{"observed_at":"2026-08-06T05:30:38.418588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T05:30:37.955324Z","title":"St- moe: Designing stable and transferable sparse expert mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.955324Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0911e7789a62487f0f221f440a90c750b331e622b09691b56a22fb7aaa0f4be4","observation_id":"e2d15f56-e33b-49f5-9a5f-b9ea67da2ed7","resolution":{"observed_at":"2026-08-06T05:30:37.955324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":52},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 2 inbound Pith citation observations for arXiv:2508.01699."}