{"as_of":"2026-08-23T22:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e2650a44b1e90d7d4a39f31fd0b821516126af628502bebba6925a0ce7e1c7d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:34:40.317688Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01149/citation-record","integrity":"/paper/2606.01149/integrity","json":"/paper/2606.01149/citation-record.json","paper":"/paper/2606.01149"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Learning 2d tempo- ral adjacent networks for moment localization with natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:48f1dca72a1f7ab7210e295e9ed588df6d4ec780c23e6d0e211a58d42e1298a5","observation_id":"22a30a15-8677-4417-9d42-539516125641","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Cross-modal moment localization in videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:58f8a20d6737ce08f3a269f48ab1af9e72b42e8949d523a6e2f70b985941fd21","observation_id":"315786f7-fc8c-4ef3-89f7-476f7a60efb8","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:d8fe2494b380af10cea9c13d68d2984759f7702cad77786caafa16e638b5e617","observation_id":"93bdc89b-1ed2-43b1-87b3-3f65931dbf00","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:ca6b892ff1159dcc4df1b583d1d39e6ba53b8a4cb3854f84c6a9ef313da0dfae","observation_id":"807a686c-b33a-40e1-8932-7b1173abde40","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Less is more: Learning highlight detection from video duration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:06de967cabb6f29dabf65ad7103c110e26e21339780aaafd06781d3bcb97e614","observation_id":"b4e9b3c8-39ed-463b-8411-a0905c6a0e82","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Highlight detection with pairwise deep ranking for first-person video summarization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:c3b71b023d9e06f053131af227f6990b082b5f5e55114a0d5bab9e4e5901daaa","observation_id":"89c41202-bb65-47c8-a209-7a234c1e3025","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Localization-aware multi-scale representation learning for repetitive action counting.VCIP, pages 1–5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:e536b51d8950f70637c62254a7d3d3027169ad76966dd86fa8e3905313c52f4e","observation_id":"3640431a-88b3-4b14-8cf3-e0e5d4455b8a","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Lavt: Language-aware vision transformer for referring image seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:e97e12eb3d8d3286337982728721d51cfd2ebae09e298f78276b15ac33802a0e","observation_id":"b014f268-1107-4027-a5de-12badeaa476d","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:87f79b9da8045176d7b6d373fb83144bc6a4fdb45770f4466c69e77911887c17","observation_id":"c63caecc-aab3-4a68-bef0-03d1df34abbd","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Detecting moments and highlights in videos via natural language queries.NeurIPS, 34:11846–11858, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:45e33f5781503513a05930ca8147a1e364544cc61e47c860adccb411b6a778a3","observation_id":"e1ae82c3-edbe-4f75-97c1-deea0dc54893","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-19T10:36:23.209538Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":"2311.08835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-07-04T03:29:31.161365Z","title":"Correlation-guided query-dependency calibration in video representation learning for temporal grounding","venue":null,"work_id":"930bf918-21bb-485f-a9a4-7951c1ac3b74","year":2023},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:a8d9e4c5151a1d30615948a797ad76c907051e0b34254cd5795b5414414e6f0b","observation_id":"569c3a6e-ca37-4806-bab2-28ef02604c43","resolution":{"observed_at":"2026-07-01T20:56:14.539786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Bridging the gap: A unified video comprehension framework for moment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:c24364d200c2f62061d2ce3ef569e114d30c1bc8eb242acbbb32495a0ea1f999","observation_id":"dcfba0e6-3f5a-42c2-a300-70b41dd16d48","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:ccbe9fe89cc7c2d328e8671c4501a6eb0916c1118c2373e9c1fb5b8ec48c07f3","observation_id":"2014460d-7925-4b21-aaf6-760aa3a13b00","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Cva: Context-aware video-text alignment for video temporal grounding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:ece480ffe8a50e8cac72f7193567bdf4c552ae74ba85e0545bcaa2bcf9ffd6c1","observation_id":"eede6fcc-7381-4bb2-8dcc-18519b08daef","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Timeexpert: an expert-guided video llm for video temporal grounding.ICCV, pages 24286– 24296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:2d9a3b3c091d6cc9b0544551ea2057ad430e41544fcdc4cd6a97c5491d50f98f","observation_id":"7b974dcb-e8a3-42ac-a021-46aeb014980a","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Multi-stage aggregated transformer network for temporal language localization in videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:bed5d5b5907693f2508f661d7248e262c746f3428252b60545f0faba380b8287","observation_id":"6d2bbe2b-bd0c-4857-955f-bf533b06a53c","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Semantic condi- tioned dynamic modulation for temporal sentence grounding in videos.N e u r l, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:0922bbc541a21aed86b47546e935b63713cc702cffb7ea7e5ccad3d936d1731d","observation_id":"c669091b-0c0d-45d0-b96f-ad8c76193dd8","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Structured multi- level interaction network for video moment localization via language query","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:3080f266a03988573dae16f2a9b833bca350a86a1bb0c4a2379428c74773d18f","observation_id":"ce2713e0-2d7a-4794-b9fa-defbfc55418b","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Video2gif: Automatic generation of animated gifs from video","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:d50217d08555373019a32ec4743a61a611de57b60bcf0069d791eec7ecce5840","observation_id":"b239ad8f-e068-49de-9c36-33222c410988","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Video highlight detection via deep ranking modeling","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:0a42cf6e15a6e4b1ca3fe0ea68e7a2438cac711e50d1d5f5b45602136aa70e08","observation_id":"17b6f008-334b-4cd0-a096-e96c48a734ab","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Joint visual and audio learning for video highlight detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:e0e1f4a1d80d143d4fd948340687dbb9b8a383e00d4782a7ccd0a164030b62a0","observation_id":"fe1d3656-4b88-4bf1-9fa2-209011b34fa7","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:b003db7202e2617878273652375de2c0b4f7113f83a37e8beea09013f569ff7d","observation_id":"a84a6e54-d1b9-4caa-8ef1-e11cfc541210","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Attentive moment retrieval in videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:5755bf700ba0a27e7068074ce15bcc59276686cfc3792b142bce5d18c8cf7959","observation_id":"c2b60d9b-d6ab-47c5-9dd1-32c47faf604e","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01337","last_updated":"2018-09-05T05:58:47Z","snapshot_observed_at":"2026-08-14T18:32:53.317342Z","submitted_at":"2018-09-05T05:58:47Z","title":"Localizing Moments in Video with Temporal Language","version":1},"cited_work":{"arxiv_id":"1809.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.01337","snapshot_observed_at":"2026-07-01T20:56:14.536024Z","title":"Localizing Moments in Video with Temporal Language","venue":"cs.CV","work_id":"f2dd404d-1f55-44a6-b39e-c0d54af4b522","year":2018},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"cited_paper":"/paper/1809.01337","citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:4bff55eb049f2a1b335e49f1490fa5b6b59ad02969e54b7201cb62b0a491647c","observation_id":"682b1ace-b821-4715-a363-8a1ab5d6f8c5","resolution":{"observed_at":"2026-07-01T20:56:14.537192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Proposal-free video grounding with contextual pyramid network","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:b5f9e792fce284fcd74ad338375465b96fb46a6e6b59881782e5ebd4615f6f46","observation_id":"fd65be01-a2c6-4484-9bde-7e789cdaa36e","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Local-global video-text interac- tions for temporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:45e72209be2aa2e7b388a17dc8c09d3818ed062fbecdfb21629ddeb25df4112f","observation_id":"019d4611-d1c9-46e7-8327-5b92d9929a4b","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Proposal-free temporal moment localization of a natural- language query in video using guided attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:0a189f856b1016dd93f9204c2984c0bc73f8ddfbd76c8f6f5096baaee56579be","observation_id":"50d7b8a5-a007-4b1f-a49c-71bbd569c332","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Frame-wise cross-modal matching for video moment retrieval.IEEE Transactions on Multi- media, 24:1338–1349, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:65d45860202cf6f23bb11d6f7f23398e478ce76c56ab501447b61070517d0ba7","observation_id":"03e962f4-8e62-4924-a5b7-ae318afa68e3","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"To find where you talk: Temporal sentence localization in video with attention based location regression","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:210ce382847d4f5a526a51e4be0215cd92cbb29dfe90b260cec6b6f17ebd6655","observation_id":"baddb296-b29d-45a8-a6bc-f511dab6999a","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13931","last_updated":"2020-06-14T08:49:07Z","snapshot_observed_at":"2026-08-20T04:16:24.606421Z","submitted_at":"2020-04-29T02:47:04Z","title":"Span-based Localizing Network for Natural Language Video Localization","version":2},"cited_work":{"arxiv_id":"2004.13931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.13931","snapshot_observed_at":"2026-07-01T20:56:14.529226Z","title":"Span-based localizing network for natural language video localization","venue":null,"work_id":"407ec088-29d9-4271-8371-41b17701715d","year":2004},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"cited_paper":"/paper/2004.13931","citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:c9feb9d19c6b59c2539337f1b174b4fb1eb7cd1579786120a7aab7129a36ff6c","observation_id":"260a7219-af8f-4735-87bc-eae83eed1ee5","resolution":{"observed_at":"2026-07-01T20:56:14.530960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Ranking domain-specific highlights by analyzing edited videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:44f7c0b30dd4c7a8cbe28c0343a27c0b9b0659cd6bd3396fe81e35e0cb997b91","observation_id":"c27b6fea-5d48-4c75-b3de-52c86e2f92d9","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Tvsum: Sum- marizing web videos using titles","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:5d33c0f57c1368e00dd6febe795e8e21f5db3cdde21ca998dee348c4837526e9","observation_id":"95fc8d5d-7119-4369-a1f5-a4e774b2df86","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"A deep ranking model for spatio-temporal highlight detection from a 360◦video","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:2067424f25e627ab4e8f03f969c2950e02841147b647bba22856425d06df9cf7","observation_id":"a257796b-3d46-45c3-9f2d-817c280f2792","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00801","last_updated":"2024-07-21T16:17:07Z","snapshot_observed_at":"2026-08-16T14:04:48.617009Z","submitted_at":"2024-03-31T21:17:48Z","title":"$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding","version":2},"cited_work":{"arxiv_id":"2404.00801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00801","snapshot_observed_at":"2026-07-01T20:56:14.533557Z","title":"R2-tuning: Efficient image-to-video transfer learning for video temporal grounding.arXiv preprint arXiv:2404.00801, 2024","venue":null,"work_id":"6013390f-acf4-402e-b114-19aae8b20a89","year":2024},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"cited_paper":"/paper/2404.00801","citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:fdbe343387423135b5cf8044692fed948b931201601879c489222fc17bf00eac","observation_id":"224309cf-1e62-4668-be3e-141ff638de25","resolution":{"observed_at":"2026-07-01T20:56:14.534958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:25b098825fde0047f7ad3c838ca7462a408cb810909ff8d07aecfe43dd1ad27d","observation_id":"3f848c19-5194-4a95-b227-c800c35b7bb1","resolution":{"observed_at":"2026-07-01T20:56:14.533265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Grounding action descriptions in videos.Trans- actions of the Association for Computational Linguistics, 1:25–36, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:4071e473b165fa11a37ec2e9479a4da15517f1b53596aa5edf2ab80c36c6edc1","observation_id":"872b2b73-8484-4820-a8e3-aacb961627a5","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Mh-detr: Video moment and highlight detection with cross-modal transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:910f1cc30f03d2311cc4dc7a2038e65c40671e66fa6769534011d7f99e7bf12d","observation_id":"3630ce14-89ba-4ba9-b58c-56b0d6afbdb8","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Knowing where to focus: Event-aware transformer for video grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:1dd844dfbde18992b7ce8e07387f25d048e7767d84942410234dd07e5c7ce6b4","observation_id":"8ebe4664-1556-4ed5-b25b-276834e71b3c","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Query-dependent video representation for moment retrieval and highlight detec- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:49740b78b09c947b348a260c81d32cf7c9c6bc1371687a611549cc65e511716a","observation_id":"b7aa1ef9-9934-4632-8560-75c88061515b","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Video summarization with long short-term memory","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:49f69648c72c12846856d5964f1bdc186cd1ec1db2aa8079cb98e33bcd345616","observation_id":"58d65551-7271-4859-ae98-a7305eac83f4","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Learning trailer mo- ments in full-length movies with co-contrastive attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:9c0463d89ceb2ba25c76d7e3444d128c543a96b63fc37e08e475fc782501e2ce","observation_id":"9e9fa9b8-03df-4717-a239-fe8b23ba8617","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Cross-category video highlight detection via set-based learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:85f8158044ca06ecd53920f85edc126943387f2e2699b9f0bb26b77840be8498","observation_id":"b9b02cda-98be-41e7-80ac-728539a6f863","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Mini-net: Multiple instance ranking network for video highlight detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:fa84415bbdbce3de4a79ce32d2171f8c40dff8f7d483f2bca41c855ebe1f3a9d","observation_id":"7bbc33d7-f84e-425c-9821-9343037ff7d5","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:34:40.317688Z","title":"Temporal cue guided video highlight detection with low-rank audio-visual fusion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:40.317688Z"},"links":{"citing_paper":"/paper/2606.01149"},"observation_digest":"sha256:bbc5afa0f8a17ecf0688def369a2b442eee5720a00cd1cc73fbbef0a4b4adbc7","observation_id":"a6e022f1-8fba-438d-a54b-74d5ab28a1c2","resolution":{"observed_at":"2026-06-28T17:34:40.317688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01149","last_updated":"2026-05-31T10:36:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T19:11:56.269915Z","submitted_at":"2026-05-31T10:36:49Z","title":"CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2606.01149."}