{"as_of":"2026-08-15T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a12c20375db7fcfa24b7400e446c593e425e0bb1460e57f3d6fd06d079dc2dd6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:23:18.768419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.255843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:212eb5e7fc7387ccd8074a3617a509635bc77ea6dae6368aca3c0e68425da35d","observation_id":"7e639819-48cb-481d-bca9-afea9da9f0da","resolution":{"observed_at":"2026-05-16T09:50:00.789565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:c9e011bdbb6cf2b45c9571121511389014685544e70b783b0c1fe89c6df5eb31","observation_id":"d552b34c-5ce0-4e56-8486-79dd1ee6230b","resolution":{"observed_at":"2026-05-16T09:20:20.353154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-13T04:42:48.186810Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T04:46:18.542521Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2401.07669"},"observation_digest":"sha256:9183b621a227e9959db43fe6a83f0c318e0b7ebe36a33f9b5e04ad0299a5fde8","observation_id":"e45785c1-8ef1-41aa-a520-d9f87f4335e9","resolution":{"observed_at":"2026-05-24T04:48:54.297379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:d0a0357167e2049b3d5d6e59b697b14aec4bc3a49a08fc840a6551ab273aaaae","observation_id":"a0f7aa7c-4b58-4382-9d42-9f1779120058","resolution":{"observed_at":"2026-05-10T23:20:33.141307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T21:23:18.768419Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08842","last_updated":"2024-11-13T18:20:29Z","snapshot_observed_at":"2026-08-12T21:13:54.192328Z","submitted_at":"2024-11-13T18:20:29Z","title":"AstroM$^3$: A self-supervised multimodal model for astronomy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T21:23:18.768419Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.08842"},"observation_digest":"sha256:865d452999cf7dbaa87b1705e278af6aeba3e312f08cf6ae2d553700c5ae32b5","observation_id":"3a1d64b6-eb39-477a-98f1-62d3e1a5c280","resolution":{"observed_at":"2026-08-12T21:23:18.768419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T15:06:04.988340Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.988340Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5b8fd38b038c8c8b5852992506c256472563dfecaaef3bdfe59eab8c6c3fb5fb","observation_id":"544c7b6c-8643-477f-b6c9-ee214541a8b9","resolution":{"observed_at":"2026-08-12T15:06:04.988340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T05:13:50.127973Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval.arXiv preprint arXiv:2104.08860, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00639","last_updated":"2025-06-02T15:22:19Z","snapshot_observed_at":"2026-08-15T07:26:24.610555Z","submitted_at":"2024-12-01T01:36:41Z","title":"Needle: A Generative AI-Powered Multi-modal Database for Answering Complex Natural Language Queries","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:13:50.127973Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2412.00639"},"observation_digest":"sha256:9ae7373933b7d9d4730210801af6523041a6c68abb236ea2864bf286ad92115b","observation_id":"8ea95b71-15e6-45ac-a3b7-82a473567ab1","resolution":{"observed_at":"2026-08-12T05:13:50.127973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-10T22:20:45.980215Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01950","last_updated":"2025-04-29T16:27:32Z","snapshot_observed_at":"2026-08-14T05:01:03.075515Z","submitted_at":"2025-01-03T18:54:26Z","title":"MADGEN: Mass-Spec attends to De Novo Molecular generation","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:20:45.980215Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2501.01950"},"observation_digest":"sha256:bd5020ae730ca915ad33c0c0ae71b06a29ec450b3e0916abbc1173f89e791b3b","observation_id":"0d5d01f8-1b03-425e-bab1-55dc2bbe0c20","resolution":{"observed_at":"2026-08-10T22:20:45.980215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-10T20:08:46.149164Z","title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09425","last_updated":"2025-05-13T06:30:11Z","snapshot_observed_at":"2026-08-15T04:34:33.617262Z","submitted_at":"2025-01-16T09:55:42Z","title":"Vision-Language Models Do Not Understand Negation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:08:46.149164Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2501.09425"},"observation_digest":"sha256:efb23dbc0bc224b72c92399bde3d26b5bf9be0b0bb951ddb23402bfbc5e53a9c","observation_id":"92c26dc6-4b83-4553-a6ca-f3662ab335d6","resolution":{"observed_at":"2026-08-10T20:08:46.149164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-07T06:05:31.747047Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-14T03:14:20.396841Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.747047Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:c9634dc4d8d2d71fc2be4e54a2db3b423ef0495653e9d9ad02d7e01e3b88d328","observation_id":"4a36bfaa-22be-4fb5-92c1-7335d9074463","resolution":{"observed_at":"2026-08-07T06:05:31.747047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T23:49:26.509966Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16258","last_updated":"2025-06-19T12:17:31Z","snapshot_observed_at":"2026-08-10T03:09:55.520770Z","submitted_at":"2025-06-19T12:17:31Z","title":"ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:26.509966Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.16258"},"observation_digest":"sha256:4c97b73d497fccf6355b654bb09b293a28d7ade150a9077ef7e6347854e21533","observation_id":"7b6c544f-d6ff-45c9-ac0f-04e709b8b115","resolution":{"observed_at":"2026-08-06T23:49:26.509966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:43:04.406744Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.406744Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:1fb07b1601290f1a75efc519dfa5b9c83ddd2ac77f40ef651dddce5916bc8e18","observation_id":"17b3a461-14f7-47f8-a8ff-fbd05e9e0b22","resolution":{"observed_at":"2026-08-06T20:43:04.406744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:18:52.176751Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03330","last_updated":"2025-07-04T06:30:50Z","snapshot_observed_at":"2026-08-13T09:33:14.150255Z","submitted_at":"2025-07-04T06:30:50Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:18:52.176751Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.03330"},"observation_digest":"sha256:1e2a224d82c049206fc1b9c91cbcdda703c412b3baa67d0e961537a4668e08eb","observation_id":"97af0fe0-60ea-4c3a-b795-75a52cc6c807","resolution":{"observed_at":"2026-08-06T20:18:52.176751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T13:23:36.569663Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20745","last_updated":"2025-07-28T11:52:56Z","snapshot_observed_at":"2026-08-14T17:18:44.422047Z","submitted_at":"2025-07-28T11:52:56Z","title":"Regularizing Subspace Redundancy of Low-Rank Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:23:36.569663Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.20745"},"observation_digest":"sha256:4e68515e85d1ce33baf6c28247d6be3216a0653a25436bb6c7d24a522c68d956","observation_id":"499b8bba-365c-49d0-80ec-fbbeb4520bba","resolution":{"observed_at":"2026-08-06T13:23:36.569663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-04T19:37:42.236365Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-09T17:50:11.271087Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:42.236365Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:279bfb575473272a6fe5ac90fd2ccd8bc5d5eb6ef59e0c19ed4cb8bde834c164","observation_id":"a0f7ebcc-fc1a-409f-a5c6-ebf1340f57dd","resolution":{"observed_at":"2026-08-04T19:37:42.236365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-04T09:27:27.954552Z","title":"Clip4clip: An empirical study of CLIP for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-13T16:18:50.395072Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.954552Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:bda9bf68be0ae55eccfc316c98f45db1ce5cdc68c2adb22d1089f785ac694048","observation_id":"f26efacf-4cd4-448b-b021-45248dea36ad","resolution":{"observed_at":"2026-08-04T09:27:27.954552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-08-13T14:28:42.446815Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:2b40cbad7b3d1f81a38cf64f863089f5e40901e16ae13b0b0396ed42cc7e5867","observation_id":"9ce8db31-0a39-4f83-822f-0b39afdb2979","resolution":{"observed_at":"2026-05-16T22:21:18.841437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-13T01:46:29.436206Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:f60c4aa7f41a91384437f7007de1823233f3c27e16cad2d24b364a907f046ebf","observation_id":"b2eb13b6-a277-40e2-a154-7f6a4c60b214","resolution":{"observed_at":"2026-05-10T23:15:50.054638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2604.09088","last_updated":"2026-04-10T08:16:59Z","snapshot_observed_at":"2026-08-11T16:03:30.442738Z","submitted_at":"2026-04-10T08:16:59Z","title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:36.306400Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2604.09088"},"observation_digest":"sha256:a05a240f2b44316c6b1d54235049f40da6c1ce92796a6f2c4551f98357b20460","observation_id":"586e7a31-488a-496e-9a38-222c98c78703","resolution":{"observed_at":"2026-05-11T08:15:58.956061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:e16f1de4d1f2649e33a0610c8c0b1ac354a5a8ce1d5aea6b981aace29d823fd7","observation_id":"5a9f84e7-0509-4cf8-a276-f9ec489e4730","resolution":{"observed_at":"2026-05-11T07:01:10.396147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.06229","last_updated":"2026-05-07T13:21:11Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:21:11Z","title":"Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T13:39:20.777029Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.06229"},"observation_digest":"sha256:ab3c7dc6b243a71a9fb0b832f7e3303e267424e2d6283d01b67d4dbb155f52f4","observation_id":"e8c95ba4-e1e7-4552-aedb-8b882c9f613f","resolution":{"observed_at":"2026-05-11T18:51:07.810751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.12145","last_updated":"2026-05-13T09:22:06Z","snapshot_observed_at":"2026-08-15T04:22:00.403778Z","submitted_at":"2026-05-12T14:03:30Z","title":"Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:46.651636Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.12145"},"observation_digest":"sha256:2bf5a0676997692fc524a528bcc6dcb02e898e485b5f198a17b05faae8b5efa6","observation_id":"87cfe60d-3ef6-44fe-9c5a-546387cc0ee6","resolution":{"observed_at":"2026-05-13T07:22:28.874868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.12145","last_updated":"2026-05-13T09:22:06Z","snapshot_observed_at":"2026-08-15T04:22:00.403778Z","submitted_at":"2026-05-12T14:03:30Z","title":"Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:52:31.915302Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.12145"},"observation_digest":"sha256:911c0c4c4b8376dbe7a19799937066a8324c27938066e1a146e145844f8ac069","observation_id":"ba1939d0-95c7-4c34-8bab-9027a636fa86","resolution":{"observed_at":"2026-05-14T21:53:02.073515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.26641","last_updated":"2026-05-26T07:26:23Z","snapshot_observed_at":"2026-08-06T17:24:19.284916Z","submitted_at":"2026-05-26T07:26:23Z","title":"OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T18:08:50.574960Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.26641"},"observation_digest":"sha256:23c34bde86f971b078cf1ce09a3e5b9dc3e5d9f53837630042b8182200330064","observation_id":"9764b215-1560-48d0-ab4e-fc4cabaa5b5c","resolution":{"observed_at":"2026-06-29T18:13:48.561178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2606.17298","last_updated":"2026-06-15T21:06:53Z","snapshot_observed_at":"2026-08-14T06:21:26.829057Z","submitted_at":"2026-06-15T21:06:53Z","title":"Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:26:49.843308Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2606.17298"},"observation_digest":"sha256:dc021d70f56bb49eca3576c4d7840851ab6532de7b29cddd2e37d9e7332db8c3","observation_id":"d78b6606-e4de-4570-a2a5-daa99bb65ab7","resolution":{"observed_at":"2026-07-03T17:58:47.526835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:43e2f2db0118946fb92ff2b530417cccc1adc52419bad5c9e6c0e6b9d5209d0f","observation_id":"52547ef6-7fe1-4c88-a9a0-ab204e70d174","resolution":{"observed_at":"2026-07-04T00:09:15.257933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2607.00446","last_updated":"2026-07-01T04:59:24Z","snapshot_observed_at":"2026-08-13T20:56:12.287244Z","submitted_at":"2026-07-01T04:59:24Z","title":"VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-02T15:09:47.855795Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.00446"},"observation_digest":"sha256:e3bccdcfe9be65556da23e08739e4c98119e4c7232e6a5202e4695164ebf3b81","observation_id":"76321b28-b6b5-4d49-8a86-e750b1d2fd32","resolution":{"observed_at":"2026-07-02T15:17:07.335570Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2104.08860 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-08-12T08:26:25.735657Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:4a6bdace9153f32c0c6879407b2df2416210e7047a94f6923264dba03b8111ec","observation_id":"eb3295a6-4ac8-4ff7-b996-ca452ecc1e35","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-15T07:50:29.346799Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:7085186204a812aa279e1b7b14b112df1ea341389d28aebf51bdcf03573c5f82","observation_id":"559a8468-8043-4bd0-ad4b-54f04ec750ab","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-02T01:01:00.937550Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14821","last_updated":"2026-07-16T10:39:22Z","snapshot_observed_at":"2026-08-13T21:05:03.889015Z","submitted_at":"2026-07-16T10:39:22Z","title":"Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-02T01:01:00.937550Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.14821"},"observation_digest":"sha256:df217fa39d443144bce19def396b05f4e543de742583d553d9125f17de0a5dea","observation_id":"371c535c-6c7c-4f15-b28d-535a3c791952","resolution":{"observed_at":"2026-08-02T01:01:00.937550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T23:14:55.353507Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15491","last_updated":"2026-07-16T22:39:19Z","snapshot_observed_at":"2026-08-13T21:26:59.532899Z","submitted_at":"2026-07-16T22:39:19Z","title":"Trajectory-aware Cross-view Geo-localization with Sequential Observations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:14:55.353507Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.15491"},"observation_digest":"sha256:ad4e90cbdea433d0431c8eff516c697189904bc02a5d0cd72fc2d9de9c4abf77","observation_id":"879e6ef0-36cd-460b-ab67-452bc62fe40c","resolution":{"observed_at":"2026-08-01T23:14:55.353507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T11:30:56.884700Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19889","last_updated":"2026-07-22T08:20:52Z","snapshot_observed_at":"2026-08-14T01:38:06.673381Z","submitted_at":"2026-07-22T08:20:52Z","title":"LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:30:56.884700Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.19889"},"observation_digest":"sha256:05c2fef487c88dd74ed8c2a8ce448c0b61f5f62da168ad12032c644873a1ee0e","observation_id":"482c4a35-b131-4ba4-a023-80cb7c0e3616","resolution":{"observed_at":"2026-08-01T11:30:56.884700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T03:02:39.899176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26097","last_updated":"2026-08-04T07:44:31Z","snapshot_observed_at":"2026-08-15T09:21:43.269865Z","submitted_at":"2026-07-28T03:54:27Z","title":"Knowledge-guided Disentanglement with Atomic Actions for Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:02:39.899176Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.26097"},"observation_digest":"sha256:be84c4749e1e664ed3ad8553d09c02868965a68a27721db29260aa4d6225ad89","observation_id":"3c406d12-39be-46f6-a23c-b57b58c50c7c","resolution":{"observed_at":"2026-08-01T03:02:39.899176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.08860/citation-record","integrity":"/paper/2104.08860/integrity","json":"/paper/2104.08860/citation-record.json","paper":"/paper/2104.08860"},"outbound":[],"paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T08:29:53.500080Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2104.08860."}