{"as_of":"2026-08-11T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca94bf1bd55075ee5753b4d601ce60ad9bb2c8c6487d0f10310eed02d6142c08","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:14.606324Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:26:05.178943Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:01:26.009993Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"cited_work":{"arxiv_id":"2505.16376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33c7438f-048c-45f9-917d-d7cf120dce7a","year":2025},"citing_paper":{"arxiv_id":"2604.19128","last_updated":"2026-04-21T06:22:29Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T06:22:29Z","title":"GraphRAG-IRL: Personalized Recommendation with Graph-Grounded Inverse Reinforcement Learning and LLM Re-ranking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:26:05.178943Z"},"links":{"cited_paper":"/paper/2505.16376","citing_paper":"/paper/2604.19128"},"observation_digest":"sha256:9ca185a3edc61eb5bed255d13d8c58f6bc63fec9631f87188ae2f26764e1f0ac","observation_id":"6ebee684-85bc-42a8-9bdc-221a2b388906","resolution":{"observed_at":"2026-05-11T13:01:26.019356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16376/citation-record","integrity":"/paper/2505.16376/integrity","json":"/paper/2505.16376/citation-record.json","paper":"/paper/2505.16376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13372","last_updated":"2023-10-15T13:48:59Z","snapshot_observed_at":"2026-08-09T16:23:59.214014Z","submitted_at":"2023-02-26T18:19:24Z","title":"Localizing Moments in Long Video Via Multimodal Guidance","version":2},"cited_work":{"arxiv_id":"2302.13372","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.13372","snapshot_observed_at":"2026-08-07T15:07:15.307506Z","title":"Localizing Moments in Long Video Via Multimodal Guidance","venue":"cs.CV","work_id":"09411157-46e7-430c-a0f1-2c43c6a02fee","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.637959Z"},"links":{"cited_paper":"/paper/2302.13372","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:34a57154c6fe51225e4ea29278cfaa8584aff2a3ed75b98420da0f37e11fefc1","observation_id":"ae2df7a1-c806-4363-b43c-c3d6edc5e93e","resolution":{"observed_at":"2026-08-07T15:07:15.370437Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:23.843497Z","title":"Is space-time attention all you need for video understanding? InProceedings of the International Conference on Machine Learning (ICML), 2021","venue":null,"work_id":"568c30a3-27f5-425f-b4f1-40fc01f65ba4","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.728042Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:40f7ffe778cca403164f72f19f5889a953d400f3add6d241de28c4e8e1c9c48b","observation_id":"734dfabf-869d-4785-8a88-7186e4675012","resolution":{"observed_at":"2026-08-07T15:07:23.916915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-10T21:52:49.568983Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T15:07:10.775331Z","title":"Acceler- ating large language model decoding with speculative sam- pling.arXiv preprint arXiv:2302.01318, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.775331Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:65103fa55855d7fa835b2868176453f7f69569d380f527aa445bd30788f39fcd","observation_id":"2fb26669-de05-4fa2-a41b-0e1898e086b9","resolution":{"observed_at":"2026-08-07T15:07:10.775331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:10.817010Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.817010Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:f67f3d25961e2283ebeb771293dab2b1630fc22ea1a3af961adeb75985b84aad","observation_id":"97a08dd2-881e-4c0b-a204-55fd37ec7454","resolution":{"observed_at":"2026-08-07T15:07:10.817010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:23.678688Z","title":"Tallformer: Temporal ac- tion localization with a long-memory transformer","venue":null,"work_id":"5579e0ad-30db-402c-862c-b65d0e2609c3","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.848752Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:970206f04ba20c373c0d2312cf470f1fbb072d46af39137ab8d4759439eeb966","observation_id":"729772a3-d593-44f0-b1eb-e8703159cb37","resolution":{"observed_at":"2026-08-07T15:07:23.763905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16453","last_updated":"2023-07-31T07:20:31Z","snapshot_observed_at":"2026-08-06T02:41:18.170608Z","submitted_at":"2023-07-31T07:20:31Z","title":"Every Mistake Counts in Assembly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16453","snapshot_observed_at":"2026-08-07T15:07:10.887272Z","title":"Every mistake counts in assembly.arXiv preprint arXiv:2307.16453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.887272Z"},"links":{"cited_paper":"/paper/2307.16453","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:18cd7199d5dbc3b439a968e126f3f5a71084b623fb0c810cd8f479e4031f34f6","observation_id":"6e4644c9-f27d-41eb-83d1-b7efe8beadfa","resolution":{"observed_at":"2026-08-07T15:07:10.887272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:23.510612Z","title":"Coherent temporal synthesis for incremental action segmentation","venue":null,"work_id":"47332ebe-e9db-4daf-b466-b9b3237070f2","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.928002Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:7dab13c8ff9713b06923a36bb37551ec3fd802e81509ba91d677ae31bf0e8e9e","observation_id":"3e662609-413c-48e1-97e7-fee21cb5d846","resolution":{"observed_at":"2026-08-07T15:07:23.593042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:23.335322Z","title":"Donahue and E","venue":null,"work_id":"5a152671-36db-4e35-a5c8-718d42e89d56","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.978946Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:f3bd2c49f608a537ff79569489daf69c7e565fc1d89333118a33d256fab85152","observation_id":"7f474fa6-7985-4052-8d49-b6e0396ffde6","resolution":{"observed_at":"2026-08-07T15:07:23.390586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:23.124446Z","title":"Ms-tcn: Multi-stage tem- poral convolutional network for action segmentation","venue":null,"work_id":"57283bc0-88d2-4264-960b-c3c34c44da5d","year":2019},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.032050Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:795adce222a1cc631ac7684ca9648d7268e97470fa5e9524a5f7bbdf825df3f1","observation_id":"7b8d77e5-45df-4c3b-8aae-0ae122dc73c7","resolution":{"observed_at":"2026-08-07T15:07:23.216465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.063010Z","title":"Tall: Temporal activity localization via language query,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.063010Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8571cd9199a12aaea4bb30cbb3908d58f7a955275591f0684a8fefd35d26e270","observation_id":"b97e68ab-2ed1-4978-a5cc-10d8a6ea3580","resolution":{"observed_at":"2026-08-07T15:07:11.063010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.982632Z","title":"Mac: Mining activity concepts for language-based temporal local- ization, 2018","venue":null,"work_id":"3a2abaa9-7f90-4f3d-a053-28be280079f5","year":2018},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.101119Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:c2b7df9a9e040256066a99e32b8a7a40987769786db014754d396bc062bc0d34","observation_id":"f94cacda-4bcf-45c7-8a20-a012775413d8","resolution":{"observed_at":"2026-08-07T15:07:23.057433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.776785Z","title":"Diverse sequential subset selection for supervised video summarization","venue":null,"work_id":"58045728-82c9-493d-9d21-36d3d373a5bb","year":2014},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.129246Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:7e8f293744fed0398fcd21c5a9b8e85e0f9d8d88e63ce1d2358055edf673e1cd","observation_id":"d5aecad4-17cf-4c81-8aeb-8ca81a215fa6","resolution":{"observed_at":"2026-08-07T15:07:22.895477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.661073Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"1c6205cf-72ee-4a8a-af17-6ada0dd173dd","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.170093Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:9532fe6397ab976941388945114b43b0ed82138e9c4fb55cb46128a531727966","observation_id":"674c5d0b-aa36-44bc-a1ae-8d076652aedd","resolution":{"observed_at":"2026-08-07T15:07:22.717856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.518709Z","title":"Rehg, and Hans Peter Graf","venue":null,"work_id":"b90fcfe6-9f41-42bc-be20-9a250fc1cd7c","year":2020},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.194497Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:91942e614629cd5b7800362fe800832608935ab4dc5d1125aaa57f4cfa54540a","observation_id":"35623d07-1852-497f-8d1f-6f03ac8bc815","resolution":{"observed_at":"2026-08-07T15:07:22.600304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.310022Z","title":"Rgnet: A unified clip retrieval and grounding network for long videos","venue":null,"work_id":"bd7c0d1c-6379-40fe-8ff0-5a34f5af4d79","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.240369Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:520f8a48af0c3e4f6ceb7795edab5e64ba964981f62a68672d68f83dc7bd5a13","observation_id":"05dd9555-a5cb-45f1-9380-0ec1d8da37ad","resolution":{"observed_at":"2026-08-07T15:07:22.434578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:22.102399Z","title":"Localizing mo- ments in video with natural language, 2017","venue":null,"work_id":"17663661-6bf0-41d0-94c1-cf8b5aba23bc","year":2017},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.288997Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:88a88b513ecb56d724772db24e06e2c0c58c0eebfde819fef70b4f49c36fabcb","observation_id":"f0b1e26a-9730-4bac-9deb-5b593f9ead1a","resolution":{"observed_at":"2026-08-07T15:07:22.190814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10918","last_updated":"2023-05-30T02:03:34Z","snapshot_observed_at":"2026-07-06T13:55:09.054207Z","submitted_at":"2022-09-22T10:58:42Z","title":"CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10918","snapshot_observed_at":"2026-08-07T15:07:11.331471Z","title":"Cone: An efficient coarse-to-fine alignment frame- work for long video temporal grounding.arXiv preprint arXiv:2209.10918, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.331471Z"},"links":{"cited_paper":"/paper/2209.10918","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:ae48895caf3dd54686cebefca32a941da59cd9eb9f153bccc2b7df51b1dde806","observation_id":"1b3328a9-c504-44c5-8cc7-94a8affa16d1","resolution":{"observed_at":"2026-08-07T15:07:11.331471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2308.08406","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.120879Z","title":"Content-based recommendation engine for video streaming platform.arXiv preprint arXiv:2308.08406, 2023","venue":null,"work_id":"24ae1171-f7b3-404e-9186-a196dece7b8c","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.374797Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:0f1d25720dc7b5cd7df3ef828d8b543d6185405af5877d74c9b9973b30005a65","observation_id":"93c1e88c-29d8-4135-8d71-93a153436513","resolution":{"observed_at":"2026-08-07T15:07:15.178771Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07322","last_updated":"2017-12-20T05:07:48Z","snapshot_observed_at":"2026-07-06T06:15:15.772282Z","submitted_at":"2017-12-20T05:07:48Z","title":"Lost in Time: Temporal Analytics for Long-Term Video Surveillance","version":1},"cited_work":{"arxiv_id":"1712.07322","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.07322","snapshot_observed_at":"2026-08-07T15:07:14.882681Z","title":"Lost in Time: Temporal Analytics for Long-Term Video Surveillance","venue":"cs.CV","work_id":"90c24122-30bc-4566-ab65-9be14d7048bb","year":2017},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.402944Z"},"links":{"cited_paper":"/paper/1712.07322","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:66f3c9338e6b1484416b37ebabfec1208d560d29a4190fd1ca8f16bf1a3aa64f","observation_id":"7192606e-4a1f-4d4d-aa8f-4374e79b8f9c","resolution":{"observed_at":"2026-08-07T15:07:14.941577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:21.900096Z","title":null,"venue":null,"work_id":"2f2fd6ba-b5c0-4cd3-867c-076ad17f52eb","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.441937Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:80a2799b5cc14686a8b6ca692dbfcc456f613e32c2666b8c8be5ae1ca658600e","observation_id":"6ce8c360-bb44-4bc6-b7c1-d62dabc69609","resolution":{"observed_at":"2026-08-07T15:07:22.003105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:21.682473Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"23cf5ce3-6c0a-4eb3-9597-75cc1b20e05e","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.484618Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8587ed59d36a6a222a02afbab6875553d2f059a57c649d65f1aaa56eb212f23a","observation_id":"d856cbe9-1cfb-4abc-b461-7f1652ef7f4c","resolution":{"observed_at":"2026-08-07T15:07:21.792669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:21.513755Z","title":"Progressive video summarization via multimodal self- supervised learning","venue":null,"work_id":"476562be-c015-4b38-a383-7cec2edaf7d2","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.517940Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:cf107b8a65d3371640cc96b38fdbe4734c988257ce25fac188c13fd269a02b37","observation_id":"a1dcf9d3-6030-41f0-8ddc-1aaeb0fcc28e","resolution":{"observed_at":"2026-08-07T15:07:21.593771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:21.323921Z","title":"Vigt: proposal-free video grounding with a learnable token in the transformer","venue":null,"work_id":"606c2dda-478a-491b-a5ab-a92a4de74050","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.561781Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:2afead8cebb251804c1d3d9c6cf0f1c3102a62f11234b439dca9bc87542e6108","observation_id":"e0209547-615e-492e-8d60-e60a7e237f92","resolution":{"observed_at":"2026-08-07T15:07:21.427704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-02T02:01:02.764427Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-07T15:07:11.602035Z","title":"Egocentric video-language pretraining.arXiv preprint arXiv:2206.01670, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.602035Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:0f2402a433f066cb73f543c5a0dd1f0ab76d9080f34633b5515f6fda533a2fd6","observation_id":"6f209de9-cbef-42f5-929f-97f2fe58167b","resolution":{"observed_at":"2026-08-07T15:07:11.602035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:21.118995Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"b7da722b-21c5-4baf-a8c7-d9869891f9c7","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.643135Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:afb1f5e2eeb654ff062eb9aaf8b9748ffc30179f6d408162a7fb338e1d27449c","observation_id":"f4f91998-4e2a-4544-86c1-69355657d70f","resolution":{"observed_at":"2026-08-07T15:07:21.206142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.952122Z","title":"Solving masked jigsaw puzzles with diffusion vision transformers","venue":null,"work_id":"418f6e4c-f733-4066-86ba-2760aea58906","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.679894Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8780df3ef233dc7e2df8b6a581a6b5d9a858387871c31cd322b0dc49c0f4f20c","observation_id":"18223565-3af8-4d9f-bda9-2307409591d6","resolution":{"observed_at":"2026-08-07T15:07:21.034976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.727492Z","title":"Lu and E","venue":null,"work_id":"f0fea134-3036-4a97-acce-09a49c956d38","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.737384Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:494de1852d8015f61463fb0350b4ecdd4ca7c08247889cdb2a9090620f5283b8","observation_id":"0a97bb5e-49a9-459a-a26d-8d0ed5367c25","resolution":{"observed_at":"2026-08-07T15:07:20.842078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.558224Z","title":"Lu and E","venue":null,"work_id":"99451d45-6e4e-4fbf-a178-aab05b3e461e","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.794901Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8c841bb1a1aeec704c7e25f8034c6ac496c50f367bbf2410b21c6c37cecd3f17","observation_id":"73c12e15-0789-4216-9cdc-37d35c818bdb","resolution":{"observed_at":"2026-08-07T15:07:20.640398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.379266Z","title":"Lu and E","venue":null,"work_id":"289a1220-270c-4b66-b322-c8ad075a673b","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.841853Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:e723e2ffae17644a9d79f97d354cb555e56e5ed1e80fa2df6730e5ae67145d43","observation_id":"12df5a69-1a8b-41c1-9e7d-17a919f0ed52","resolution":{"observed_at":"2026-08-07T15:07:20.479122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.265606Z","title":"Self-supervised multi-object tracking with path consistency","venue":null,"work_id":"1433c77c-b94a-435a-9f64-0d4d2292d97e","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.885049Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:39ac48bd22203926595e1a837e825f4d1906a6c1524f52a223d24cbaf2031be2","observation_id":"7aa635ad-2067-4c45-97bf-d0f4c6f5fd3b","resolution":{"observed_at":"2026-08-07T15:07:20.334624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:20.098680Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":"019e08dd-fff3-4067-a73a-e12d22ccf726","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.928092Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:6a2c48adcd2ce3ef21007a22bc821b31c6b794349799b60fcda155ce36e3a8e1","observation_id":"f4f58543-8c9b-4e7a-99ab-86770587d2e9","resolution":{"observed_at":"2026-08-07T15:07:20.171523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15379","last_updated":"2023-09-27T03:15:52Z","snapshot_observed_at":"2026-07-06T16:24:10.053246Z","submitted_at":"2023-09-27T03:15:52Z","title":"A Content-Driven Micro-Video Recommendation Dataset at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15379","snapshot_observed_at":"2026-08-07T15:07:11.974373Z","title":"A content-driven micro-video recommendation dataset at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:11.974373Z"},"links":{"cited_paper":"/paper/2309.15379","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:550498f6e3ff12075393d9f31c758f6b18b7dd76b901e552d0c4cdbd9f398e0c","observation_id":"65040187-f3a8-4328-b01b-fa54e4bcfa09","resolution":{"observed_at":"2026-08-07T15:07:11.974373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.922268Z","title":"Scanning only once: An end-to-end framework for fast temporal grounding in long videos","venue":null,"work_id":"8a1a40c3-4ba5-4689-96fd-7afbb0cb558a","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.012039Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:0170d3362613e87e8cada48044e0bbc30c93c981cb22296891b0b399c8904d21","observation_id":"2ed9acad-3552-4782-86f8-daa8f8ed2f07","resolution":{"observed_at":"2026-08-07T15:07:20.013771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.800253Z","title":"Category-specific video summarization","venue":null,"work_id":"f8e7d7a8-8a8d-4d0e-b115-e7976318c217","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.109593Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:e1dfd1e85d7f4759f3dc8ae7f839335440f988c10ca403df0bd3850ef30452bf","observation_id":"80d047d1-24ed-4fbb-ae91-0228c9368a94","resolution":{"observed_at":"2026-08-07T15:07:19.841094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:12.186234Z","title":"Ramakrishnan, Ziad Al-Halah, and Kristen Grauman","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.186234Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:f3ff5cb20c1fdad8a0cbada044d2e3d61d59cb5024569a318c185a0382e1cb26","observation_id":"0e4725ca-c5a2-42ee-926c-82a4f43cff61","resolution":{"observed_at":"2026-08-07T15:07:12.186234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.594215Z","title":"Ground- ing action descriptions in videos.Transactions of the Asso- ciation for Computational Linguistics, 1:25–36, 2013","venue":null,"work_id":"bbc19fce-097f-4785-935a-a7a97713edd8","year":2013},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.248940Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:358ca784b89f64e5e74d50809b8adc8f9e635b826e34207ce2e8c1e51016eb15","observation_id":"5f4a9b6c-6c12-468a-8bba-777f6d16c05e","resolution":{"observed_at":"2026-08-07T15:07:19.654233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.520904Z","title":"Ground- ing action descriptions in videos.Transactions of the Asso- ciation for Computational Linguistics, 2013","venue":null,"work_id":"7960de0e-f067-4a3c-a829-4dfb43121bb2","year":2013},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.307141Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:468fd680971e4780adb343ee11dd0f9fe832b26ec7358e5a6323a973601f7c26","observation_id":"10c82358-3c0e-4a08-b48d-97dc43009052","resolution":{"observed_at":"2026-08-07T15:07:19.547586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.455313Z","title":"Hat: History-augmented anchor transformer for on- line temporal action localization","venue":null,"work_id":"c9bf5a29-3e5c-488d-9ab4-126a64d8985e","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.365353Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8293e24fdaa9c525d4dc1687ea2ec414a8ee9ea28c51db9bd4f9c446da3a7d13","observation_id":"893d8742-df23-435d-8e87-b450ad34db36","resolution":{"observed_at":"2026-08-07T15:07:19.489412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.315453Z","title":"Shen and E","venue":null,"work_id":"277a3017-056b-4e02-be53-7ae539b4501f","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.424077Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d01c20db72131c33274b5d0caed630040e59c3373445091784a57e09a36b3b47","observation_id":"e8d5ded5-5525-4e78-820d-3a4a3e432de4","resolution":{"observed_at":"2026-08-07T15:07:19.386716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.157254Z","title":"InHollywood in Homes: Crowdsourcing Data Collection for Activity Understanding,","venue":null,"work_id":"a477f09f-eb2f-4893-9819-f362cc0ca379","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.473874Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:a7b629d546fddbb3c4f0b142a8e21c454809b9823fa55bcea921c2a2fede4f01","observation_id":"6cbb5ee6-ff88-422a-af6b-5945ab43b42b","resolution":{"observed_at":"2026-08-07T15:07:19.234164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:19.058625Z","title":"Sigurdsson, G ¨ul Varol, X","venue":null,"work_id":"1fade801-5ee3-4f98-bd79-16d6b4bf1234","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.525896Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:bd8656dd9526ca56e1d713454677ca83abc170c76bff34313aef6e18287d7f8f","observation_id":"d5fbc5da-bab8-4139-9844-5c383b082d40","resolution":{"observed_at":"2026-08-07T15:07:19.100720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.938547Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":"d6d31370-a691-4626-8aea-a292f769af32","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.569443Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:4420e7775094be9a8c93dae784d2a9f89277d42e77f3b0bd4cdb7d4920f384fd","observation_id":"237a60ed-e9ff-4250-b006-2b01d5b73066","resolution":{"observed_at":"2026-08-07T15:07:19.017125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.810945Z","title":"Multimodal sparse transformer network for audio-visual speech recognition","venue":null,"work_id":"392c4d33-be77-4bc3-b205-5bf01a843989","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.617394Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:446a9b14411988a6a2acb1c8ef3ec6d08fe7669fe21dd6d82f597f71e8c0386d","observation_id":"bb10ed4c-3ee4-468e-9e95-4c92540a1cf2","resolution":{"observed_at":"2026-08-07T15:07:18.863756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.657133Z","title":"Ego4d goal-step: To- ward hierarchical understanding of procedural activities","venue":null,"work_id":"a28a1495-6722-4452-896f-2cdd582feeb3","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.660497Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:fba6e8729c81d46314dacac65c2e481f2f7cbdb6d5ddbd864d1f3dce92c0d136","observation_id":"7f085ade-1ed3-46bd-b6b6-01e68637e3d6","resolution":{"observed_at":"2026-08-07T15:07:18.746797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.475142Z","title":"Two-stage active learning for efficient temporal action segmentation","venue":null,"work_id":"4d49b151-098a-444b-808b-1d6010f15524","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.715423Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:2d747fe3b11a9f504a7402546983bb82fd3e3918e32c19a9f97a9ac7f05ff99e","observation_id":"39b975e9-f9bc-4d2d-9670-4e37eda2f6bb","resolution":{"observed_at":"2026-08-07T15:07:18.564093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.312810Z","title":"Structured multi-level interaction network for video moment localization via language query","venue":null,"work_id":"862c9b41-a7c2-45ff-b6f6-15228e212f10","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.808569Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:434ab395e7ecc41f01af2c37801e817d37a8a3b2172ff27df1aea24fca22313e","observation_id":"9af6307d-f0be-49f8-82c1-7a03a0371ef2","resolution":{"observed_at":"2026-08-07T15:07:18.365519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:18.096175Z","title":"Tempo- rally grounding language queries in videos by contextual boundary-aware prediction, 2019","venue":null,"work_id":"df2492a7-41be-4e7a-96b7-a5f79f21ad34","year":2019},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:12.960038Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:def0767aeee879f6b79707052a6e556529f7a11259da474244af15638622afe4","observation_id":"686d4f19-9817-4f86-a74d-324e4eabae3d","resolution":{"observed_at":"2026-08-07T15:07:18.257699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:17.782186Z","title":"Language- driven temporal activity localization: A semantic matching reinforcement learning model","venue":null,"work_id":"dd2aac3c-95b4-47fe-8557-64d28d7f081f","year":2019},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.079940Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:c6742812348a177eb9f6e948fced59d327d129bc4efe7222cdbc0321332b1e2d","observation_id":"81de695d-3da6-4bb5-9847-19c1206b44ee","resolution":{"observed_at":"2026-08-07T15:07:17.963263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:17.358243Z","title":"Proposal relation network for temporal ac- tion detection, 2021","venue":null,"work_id":"84c451fd-24be-4cdc-9cf2-2a25bfdb5c29","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.169756Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d54bcaf406105529fdba5d06a16a26b7053d0f518768a57d49830f891701c73a","observation_id":"e9ec5d3b-880d-4758-b719-f6cbaf8a96e1","resolution":{"observed_at":"2026-08-07T15:07:17.474785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:17.246241Z","title":"Video- groundingdino: Towards open-vocabulary spatio-temporal video grounding, 2024","venue":null,"work_id":"deaf3caa-cee7-4e83-99b6-ad018c1d99f2","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.259145Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:9f443721d2368432ec9bac47e487a8b0e3fc355aea4f80c469c03bcd2b8317e0","observation_id":"d81ad141-bf29-436b-bf85-92275907fadc","resolution":{"observed_at":"2026-08-07T15:07:17.284477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:17.102030Z","title":"Explore-and-match: Bridging proposal-based and proposal-free with transformer for sentence grounding in videos, 2022","venue":null,"work_id":"1a187af3-1004-4b19-9eee-b9b65104be7a","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.344212Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:bbf698a4550fbbdbe84be6c4b01eb7bd738dd9a52f9cf53a318d49c85ec3e1eb","observation_id":"ba9b674a-1c4c-499b-bce2-0dcb3499a4a0","resolution":{"observed_at":"2026-08-07T15:07:17.165516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:17.006180Z","title":"Multi-modal circulant fusion for video-to-language and backward","venue":null,"work_id":"95d27878-d24a-4505-a101-268ab0bd9715","year":2018},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.433959Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:0d93a5fd96cbf22c3ae42448f4b94e536abbf8367c33eb525406231adeb3d176","observation_id":"11986a67-715d-476f-a440-7fa7ada86f8d","resolution":{"observed_at":"2026-08-07T15:07:17.065827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.809376Z","title":"Long-term feature banks for detailed video understanding, 2019","venue":null,"work_id":"bcf5b4ce-8614-4f1b-ab06-b846115a97c5","year":2019},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.493808Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:9a4b494a8be566289b4da08b7b2fd4b4933827d70a7dea4577b9e944111c5c95","observation_id":"6e128eb1-2fab-488b-b1ca-211c9bb273b4","resolution":{"observed_at":"2026-08-07T15:07:16.960157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.669494Z","title":"Efficient and effec- tive weakly-supervised action segmentation via action- transition-aware boundary alignment","venue":null,"work_id":"e7c3860a-7b9c-4a81-b08a-2c2d0f5fbf5c","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.572763Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:8fe13ba8e8136f91176673b3a4f8d979b891502bf7a6d4576daf1b972f014f99","observation_id":"f3c65e69-0fd5-471b-ba6b-f6a908547ad5","resolution":{"observed_at":"2026-08-07T15:07:16.697607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07468","last_updated":"2017-04-11T01:21:20Z","snapshot_observed_at":"2026-07-06T04:54:03.876286Z","submitted_at":"2016-04-25T22:53:55Z","title":"Long-Term Identity-Aware Multi-Person Tracking for Surveillance Video Summarization","version":2},"cited_work":{"arxiv_id":"1604.07468","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.07468","snapshot_observed_at":"2026-08-07T15:07:14.719763Z","title":"Long-Term Identity-Aware Multi-Person Tracking for Surveillance Video Summarization","venue":"cs.CV","work_id":"d32a5c2f-b3e2-49ca-9c3b-6cdeaf5a0c0b","year":2016},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.663842Z"},"links":{"cited_paper":"/paper/1604.07468","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d1f18e1af373cb9f1f330da675a9b830eb054e0954aca4f98c399824666bca72","observation_id":"0119c123-2cc9-4b07-9e39-b8a7bbab84c3","resolution":{"observed_at":"2026-08-07T15:07:14.792053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.595820Z","title":"Dense regression network for video grounding, 2020","venue":null,"work_id":"1e8d726d-2f8e-4904-8138-02cd4fb82384","year":2020},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.722954Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:467013d774db22068bb7ba30e09d16a3de847f124cd21ac3a60585d8433ec40c","observation_id":"8f2976d6-99d4-4df9-b5dd-fef45ba6e2f7","resolution":{"observed_at":"2026-08-07T15:07:16.628692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.417605Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"b62e0326-83d0-45af-b3a5-97be2b7725d6","year":2022},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.785770Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:0db18036bd8bbcc8ca0b81b0ea16e392694cdba848a2b8ddd362103476054a27","observation_id":"1d7392de-c06f-4158-9df8-52124c9f9e73","resolution":{"observed_at":"2026-08-07T15:07:16.510486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.290888Z","title":"Helping hands: An object-aware ego-centric video recogni- tion model","venue":null,"work_id":"16fa594a-b4d8-4376-8831-76a1cb6b854a","year":2023},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.831060Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:3c6a28ba7dffb95635f22f07c0dfd6be13518297a0f1274809c9be8562bc68bb","observation_id":"171d98dd-c7fd-4384-96b3-282bf3bc9fda","resolution":{"observed_at":"2026-08-07T15:07:16.341490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-09T22:51:36.749081Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-08-07T15:07:13.924824Z","title":"Span-based localizing network for natural language video lo- calization.arXiv preprint arXiv:2004.13931, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:13.924824Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d743864e981a30a190237184ba290343946e7bb668c50cb2f41d14ef1249b068","observation_id":"1f2ab522-d356-44f2-9857-32b249d58841","resolution":{"observed_at":"2026-08-07T15:07:13.924824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.211404Z","title":"Multi-stage aggregated transformer network for temporal language localization in videos","venue":null,"work_id":"a8167787-2f3c-4251-960e-a7dd2328461a","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.006691Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:4fdd906e0a82d4e250fb512ebc54693f6c339493614650f99ddf276f3b95828b","observation_id":"57cea86e-65e5-4927-8dd8-dd787b05cf85","resolution":{"observed_at":"2026-08-07T15:07:16.241881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:14.093990Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.093990Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:9cc9f3982e90857093a2ad98e58c8fa42e642d5a63d1f2867e2607c22a74d282","observation_id":"5a6dd1a7-85af-4112-9c28-8cd967ff9b6e","resolution":{"observed_at":"2026-08-07T15:07:14.093990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.122416Z","title":"OnlineTAS: An online baseline for temporal action segmentation","venue":null,"work_id":"e028af27-3da5-426b-861a-2a24299fac15","year":2024},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.176877Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d93b2367405c593d714bb0011e4858561c644875eb96c897edade6d3972adf71","observation_id":"65b03869-a344-41b4-8491-922c7fa9cad5","resolution":{"observed_at":"2026-08-07T15:07:16.166523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:16.040975Z","title":"Enriching local and global contexts for temporal action localization, 2021","venue":null,"work_id":"4d39a86b-543d-471c-a08d-0a4e55b46ce2","year":2021},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.266791Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:6dcc8e0022afe97d468b9f8f1c2b0e5e467dd6a24ff7c7767edb406b89820f35","observation_id":"f4150bea-bea4-4233-85db-bf828553f88f","resolution":{"observed_at":"2026-08-07T15:07:16.074840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.958132Z","title":"DeCaf-Grounder consists of the following key components: query-aware temporal aggregation, multi- scale temporal refinement, and classifier & regressor","venue":null,"work_id":"cb2353c6-9c50-46fe-b981-75cafca833e4","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.329132Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:7787d5485caddd67e010a8a23e7a1502814b0a737b1c64e06aa4be3002be4302","observation_id":"880c5aee-b2ef-4c2e-bedb-6dd68f762e29","resolution":{"observed_at":"2026-08-07T15:07:15.996412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.873247Z","title":"In Table 12 of this supplementary material, we also show the computation on Ego4D-Goalstep dataset","venue":null,"work_id":"fc0928a1-6ddc-4a2e-a3f1-32d94b884436","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.409655Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:d8d1c43a8a4de61ee2b751cf7efaf73b6891eec71c5ead4c0b236add41ccb8b1","observation_id":"73913b8d-8d78-4e82-81a2-4d1ca8d3213c","resolution":{"observed_at":"2026-08-07T15:07:15.919095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.745387Z","title":"Their settings are consis- Figure 4","venue":null,"work_id":"c1619b65-42b8-401f-a9a4-add1ea6e2ab2","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.493749Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:ec6503ba439ff995947327f22663ee240c715474ad890e9d1fad2fb224d4ecea","observation_id":"6ab0e166-285f-4d74-96f2-2f7acefcd28a","resolution":{"observed_at":"2026-08-07T15:07:15.815842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.590906Z","title":"For tem- poral convolution [29] in multi-scale temporal refinement, we use 8 layers, where the dilation rate of thei-th convolu- tion layer equals to2 i","venue":null,"work_id":"c8f3d0d7-7b5a-40c8-b511-4a54d98514c6","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.558158Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:c33f906506dda386509a4b64f83c2481e258cb907a7d0ff11c13eb7c66ed994a","observation_id":"3ceb6c10-5ae9-43ba-85e3-9525209cd799","resolution":{"observed_at":"2026-08-07T15:07:15.668468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:15.442712Z","title":"Where was object X before I used it?","venue":null,"work_id":"76628f7a-997b-44d7-a71a-9640856d508f","year":null},"citing_paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:14.606324Z"},"links":{"citing_paper":"/paper/2505.16376"},"observation_digest":"sha256:a397ba03c53c1af59ec9a1af048c7d8bdb2ae43d149cad1ae044e848c281cc2e","observation_id":"378c83d9-9d18-4883-ae17-49e3ebe721f3","resolution":{"observed_at":"2026-08-07T15:07:15.525564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16376","last_updated":"2025-05-22T08:29:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:35:36.716982Z","submitted_at":"2025-05-22T08:29:57Z","title":"DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":53},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2505.16376."}