{"as_of":"2026-08-13T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ec334e3a674fb02cae4ffbab790ae773cb0689b99aff195b27fa5892392f8ab","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:51:32.331261Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11223/citation-record","integrity":"/paper/2411.11223/integrity","json":"/paper/2411.11223/citation-record.json","paper":"/paper/2411.11223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.936496Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":"bae95ebf-922f-4800-9f58-fbfd2cdeeeb4","year":2017},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.157689Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:309c521f8cce3e639dc144d9ecd077b024aa87842c8d1616aff83e7edecd9b18","observation_id":"c05c3e24-0778-469d-a368-8a74ab018d5c","resolution":{"observed_at":"2026-08-12T18:51:32.941389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-12T17:41:53.544669Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-12T18:51:32.163043Z","title":"A short note about kinet- ics600","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.163043Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:08878b66a8f02199d92e68a5e50c398e97d0b04950dc91389fb0f0a6571b268b","observation_id":"bc68abc1-ba72-4fbc-83c8-1793b0d665b7","resolution":{"observed_at":"2026-08-12T18:51:32.163043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09872","last_updated":"2024-08-20T07:52:08Z","snapshot_observed_at":"2026-08-13T00:29:48.066226Z","submitted_at":"2024-04-15T15:43:52Z","title":"Conditional Prototype Rectification Prompt Learning","version":2},"cited_work":{"arxiv_id":"2404.09872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09872","snapshot_observed_at":"2026-08-12T18:51:32.471582Z","title":"Conditional Prototype Rectification Prompt Learning","venue":"cs.CV","work_id":"9509b3a7-6bcc-48c3-9b9b-aeefd98d642c","year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.167655Z"},"links":{"cited_paper":"/paper/2404.09872","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:e44687719c186013dda0ad5fb66b29bc0cdc0322a17bcfe8d853da458fdd1762","observation_id":"06def9af-1602-4a13-b661-b199d33f22f8","resolution":{"observed_at":"2026-08-12T18:51:32.477848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.923415Z","title":"Elaborative rehearsal for zero- shot action recognition","venue":null,"work_id":"66ff105d-3b5d-47a3-bd34-baaa20e6a847","year":2021},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.172404Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:973e2bb3e27e0c4e56f0f719473981abc4073ae25513ac99fe88ac6ab727a0c3","observation_id":"84871c5d-bd36-4ce6-9ab6-e5971deade99","resolution":{"observed_at":"2026-08-12T18:51:32.927182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.910505Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition","venue":null,"work_id":"d3861997-22e8-472f-b6f4-21e546518bed","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.176661Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:c907da69ee38cb87cf1ab27c62acf1ac779fbf91f7580549ff08ca593f78b27b","observation_id":"02df26ee-5fed-4ccd-af74-e1c2748f3e0c","resolution":{"observed_at":"2026-08-12T18:51:32.914675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.896771Z","title":"OST: refining text knowledge with optimal spatio-temporal descriptor for general video recognition","venue":null,"work_id":"5e027132-8ebb-4b25-8341-2b9804d6ed9f","year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.180797Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:d75294ae9045a4cc3d6e23bca2cbabe33432562c2dc2f534e16e505b77336faa","observation_id":"dd0a75b9-e3e4-428b-b984-d6f95203b989","resolution":{"observed_at":"2026-08-12T18:51:32.901484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T18:51:32.185399Z","title":"Deepseek-v2: A strong, economical, and ef- ficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.185399Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:cda9a4637202bf64518bb36ff6008a6ee6c083b9caaced34589de07a8021e837","observation_id":"64169dcd-7543-40cd-b53a-7a7859339e53","resolution":{"observed_at":"2026-08-12T18:51:32.185399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.883269Z","title":"BERT: pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"729290b2-308b-4234-a90b-7bed9e681b1d","year":2019},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.189867Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:9527fc09e9484e4d0b10e22d36167903b5a378d875bc523b8df60551b030f50c","observation_id":"a73a580d-1cfc-47bd-8984-ce9645fcb818","resolution":{"observed_at":"2026-08-12T18:51:32.887646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.869348Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"78d8c0ec-edef-4aa6-a1a3-0049e142d168","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.194005Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:563614c4642b8292addf8dbbdb14b71fa8459a426242ceecb57090ad02ae8450","observation_id":"51e2781d-4dfb-4305-991d-d954ceaa4437","resolution":{"observed_at":"2026-08-12T18:51:32.873866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.198261Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.198261Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:1f7a4a925bae101bad2aa29724b176cf30f101c87ece71d2ce77ace1b2711060","observation_id":"d24d709d-cf16-48ae-8cd8-637ddf5e4aca","resolution":{"observed_at":"2026-08-12T18:51:32.198261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.847219Z","title":"Zero-shot and few-shot video question answering with multi-modal prompts","venue":null,"work_id":"3687e624-2646-417f-80f6-582cc4a75cdb","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.202528Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:9bd1c84c7e52fa7a98947061e650ab64d87f92b925f89a4e747cedb71df59333","observation_id":"c89b2d0f-cf04-4968-b43c-cda9938ac3f0","resolution":{"observed_at":"2026-08-12T18:51:32.851728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.834213Z","title":"Promptdet: Towards open-vocabulary detection using uncurated images","venue":null,"work_id":"6e0e72bb-605d-424b-ba4d-056dee3513f0","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.206377Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:dbfe9e58940ef3c523ed3e80a4dc4b646b048d6cb2f7570f853cc2ff5434c560","observation_id":"ef64be30-d0f7-4ecc-a849-f314d3d0eb7d","resolution":{"observed_at":"2026-08-12T18:51:32.838213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.820665Z","title":"The ”something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"332f2e87-7b7c-4a50-8de7-387bea3381eb","year":2017},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.209926Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:a5b59e8b31e142d0bf327ea74a0b088024a78692ad99b9866c73b4484a2f7527","observation_id":"4f0f3511-9d45-4e68-9ea5-bb245398a014","resolution":{"observed_at":"2026-08-12T18:51:32.825448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.806524Z","title":"Delving deep into rectifiers: Surpassing human-level perfor- mance on imagenet classification","venue":null,"work_id":"31e75cf6-89ea-45c7-bd7a-9ab74674c4bb","year":null},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.213285Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:0f590de850cce08a6891784ba002a35f6fdcc62565f79808142c34d8cebe73a1","observation_id":"c30ee68f-84f5-41f6-a264-a0002c0a3b52","resolution":{"observed_at":"2026-08-12T18:51:32.811000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.792507Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"9a704291-4591-4b8d-83db-e729dab47019","year":2015},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.217131Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:f3b614f7bf814bee7879b093739fddde7606cbf94dfe81cd25bfdb4a2cab934a","observation_id":"d44bca27-8f3d-493a-9aff-f5a3b43d41e0","resolution":{"observed_at":"2026-08-12T18:51:32.797187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.778403Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"e8ae97cb-a484-4dd8-a73b-b82febb9b431","year":2019},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.220676Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:fba86e0fd1d3e66a098b2f536c3eca968c38b06d5ad838dd650d4831a3d07653","observation_id":"a0b527de-e7ec-445c-aa64-96004d7203a7","resolution":{"observed_at":"2026-08-12T18:51:32.783218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.765155Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"363700cb-703c-4ea7-8745-8ac5093abb7c","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.224073Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:1b1a4252c29692e3db6469da2ec88ea7dac34c608721b15e58f08962500f91b1","observation_id":"fb9340b1-89c0-49ca-8d43-cd58e4858111","resolution":{"observed_at":"2026-08-12T18:51:32.768964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.751417Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"d95d20c3-7ff4-4d9b-b75d-84d18f9de4bf","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.227996Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:b686fc70ce183d79bca5e17a027b133d793f46b453fafedde556f616370cd0ee","observation_id":"0009498b-7b35-422f-88fa-d868da4253bd","resolution":{"observed_at":"2026-08-12T18:51:32.756022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.737761Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":"ecb368f1-ceb2-472b-aac6-d9aa939d843d","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.231907Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:b1f3732e9ab73c3d6e4e50b7ac9ccada3dc0b2887886924da2c6a077002a468b","observation_id":"2233691b-1772-495b-b8bc-66f9d17a9519","resolution":{"observed_at":"2026-08-12T18:51:32.742319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.723754Z","title":"Poggio, and Thomas Serre","venue":null,"work_id":"7b093165-7c9a-4d7a-9126-fd115ae8db1f","year":2011},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.236217Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:7d0952bc15e0320304c660b9b14b4d07c8b4f194bf352e0fdb43acec2ffd8bf2","observation_id":"6fe6aa39-a558-40da-93cd-f0564bc07fdb","resolution":{"observed_at":"2026-08-12T18:51:32.728632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.710381Z","title":null,"venue":null,"work_id":"2712cf10-8b96-4799-a3b8-dd135a46adeb","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.240182Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:c758181e26bdf2e03d9742f45cbb23fd69c81b74e99c1b9d62d6fb1781c3b078","observation_id":"5f8e94e0-9fba-466a-a96c-785bfdd9c4c4","resolution":{"observed_at":"2026-08-12T18:51:32.714590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.244229Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.244229Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:2f618f611fc64948e1a2af3cef9e7986629c77f227f3ed86778ed92193ae2eea","observation_id":"b1f5c81a-c436-4ae8-8a69-dea6eea4028c","resolution":{"observed_at":"2026-08-12T18:51:32.244229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.689555Z","title":null,"venue":null,"work_id":"565ccbf5-2237-485f-98aa-722002a4bf2e","year":null},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.248199Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:a5bf8c99b75747eb9627385370c189b01f10e088d482dc8dc5c46fad24752c13","observation_id":"dcdf8144-d4b5-431f-8236-67c2c8e8532a","resolution":{"observed_at":"2026-08-12T18:51:32.693148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.676747Z","title":"Expanding language-image pretrained models for general video recognition","venue":null,"work_id":"4bcdef07-72ba-4363-9add-e3292155c93c","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.252190Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:0d2c49b4b4e3ee4ca93107639026fa47ca81597545044c72b43712448f9f353d","observation_id":"e7c95845-99dd-4121-a314-3af3bea6996b","resolution":{"observed_at":"2026-08-12T18:51:32.681209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.662782Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":"59e31861-83c0-4668-9ec1-0b94b2428540","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.256194Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:7d8a0231400bbb3b27b2ca160e6b86e4839aaf88d46757904b9f49ee917daa29","observation_id":"f2ba8a1d-2690-4d1e-93e9-4de8e9658d3f","resolution":{"observed_at":"2026-08-12T18:51:32.667757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T18:51:32.260261Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.260261Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:d2ea764806bcf69afdbbdef4b8d62d5417fc55714cb066c723fc6d922423246d","observation_id":"2a9380f7-b780-4151-9c3f-689c1e994bc9","resolution":{"observed_at":"2026-08-12T18:51:32.260261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.649321Z","title":"Haupt- mann","venue":null,"work_id":"b484231d-3eb9-4a8d-9df6-f8af417a5e76","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.264647Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:a20f34bdd46d33e0d4cf370f970cf3ae5faabd0288461658db4fcdc23c7f1a16","observation_id":"374f26f8-07b6-48d9-a5d2-1cd86c548d40","resolution":{"observed_at":"2026-08-12T18:51:32.653674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.268714Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.268714Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:c92a6b9d6b8973b3cda88fe6b060364bbb36986bfe07f61820c8bb35b24ad798","observation_id":"0d756e45-12dc-4f09-a5e3-5c1ee58985c3","resolution":{"observed_at":"2026-08-12T18:51:32.268714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.627031Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":"ce6f934d-1ca5-4676-bd48-faa3329375cd","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.272633Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:ba8dc9b7a7ef777de6a35a74cbc6b886f2cdd2d140af1545e3827c8404b7fe77","observation_id":"8a18f7be-87a1-4fa1-90bf-1c4c2c66c01d","resolution":{"observed_at":"2026-08-12T18:51:32.631293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.613335Z","title":"Consistency-guided prompt learning for vision-language models","venue":null,"work_id":"6a730197-9272-4536-8025-54c2042b7999","year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.276907Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:b40589ca32a51bb38808a50a7b48066c1d6d681777a11c787357fc678b593aaf","observation_id":"cd0f600c-53c6-4a02-aefc-ffce390002b5","resolution":{"observed_at":"2026-08-12T18:51:32.617576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T18:51:32.280808Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.280808Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:934f92628ba95bdfcaf29308d36fce8a6dc09270d0fdce5863360db8a07d49a1","observation_id":"a9605f1f-4c3d-4b1e-aad5-a329a9c4cddb","resolution":{"observed_at":"2026-08-12T18:51:32.280808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.599664Z","title":"Video- mae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"fd4e56d1-7a40-4473-8203-f35feb9f6fba","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.285071Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:2dc81cb352b9dacb7d2ec094c7c27f2ee6d566a651ad7e4bf9787872c84e4aa3","observation_id":"f79f76ee-461f-4f68-9051-2391cd078b98","resolution":{"observed_at":"2026-08-12T18:51:32.604232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T18:51:32.288909Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.288909Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:1b742d1289343a5b25eedd73ccc2e0f18c14f696bad421a7e4526df42cef9b7e","observation_id":"51ae5c49-5551-4193-8894-c2e01e346428","resolution":{"observed_at":"2026-08-12T18:51:32.288909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-12T22:18:23.713183Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-12T18:51:32.293134Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.293134Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:ab885ae0e488e58454fb1f27479d30355612023bffdac7366d77127f8afc4c48","observation_id":"f257c5ef-fb14-4fb8-b53a-c31a223251dc","resolution":{"observed_at":"2026-08-12T18:51:32.293134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-12T18:51:32.297314Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.297314Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:545377b47c31eb47e4af67173ffc3769ab156d4e383058eeef7472b3cbf680d0","observation_id":"c447dbe6-346e-4474-ac13-16f21c6f1b55","resolution":{"observed_at":"2026-08-12T18:51:32.297314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.585714Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"c8ff28be-3d4a-457a-afbd-b3b200d8d049","year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.301670Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:c69981c5ef767cc17efb5ee0f41ced7e66b459e294949ef0b2542c83167af027","observation_id":"29ffe277-2538-41a7-b97b-982aa7d11776","resolution":{"observed_at":"2026-08-12T18:51:32.590644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.571847Z","title":"Khan, Fa- had Shahbaz Khan, and Mubarak Shah","venue":null,"work_id":"8163a882-656e-4c98-b515-26062178188e","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.305641Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:c21c6791dcf36fb4d126adf16e30691d741927ce4af4bacdd411eb554d96383f","observation_id":"2fac2da3-01b3-467d-99af-5091d5ddbd49","resolution":{"observed_at":"2026-08-12T18:51:32.576314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.557556Z","title":"Open-vclip: Transforming CLIP to an open-vocabulary video model via interpolated weight optimization","venue":null,"work_id":"9c35c71b-5f49-436b-b99c-3b7e260cf99f","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.309484Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:b61bb96118bdb3d8010726d81d8c8e908087f6513e0e2e178121de69d62b9ab0","observation_id":"17a54940-769a-48e2-9215-5c7565ea1cb1","resolution":{"observed_at":"2026-08-12T18:51:32.561506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.543670Z","title":"CORA: adapting CLIP for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"5b168e27-99d9-405a-bfe5-05af8e26fd18","year":null},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.313381Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:5b7a806789cde01f0a4c315d52d8ab1908f9dc4d707c41dc4b351a1fd71c1ae5","observation_id":"5a0174dd-4fa7-477b-a97e-061346b1add6","resolution":{"observed_at":"2026-08-12T18:51:32.548119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.529499Z","title":"MMA: multi-modal adapter for vision-language models","venue":null,"work_id":"44a60af4-072e-494a-a7a8-e9a8ff406623","year":2024},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.316907Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:b9fbe4ca3b6ffa6c80e6a190fe3d0dacee6a4e2a014c5dc09cc581393c746561","observation_id":"f6e9fd4c-d2e2-428e-b48b-7ef8972cf0ed","resolution":{"observed_at":"2026-08-12T18:51:32.534607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.515886Z","title":"AIM: adapting image models for efficient video action recognition","venue":null,"work_id":"c81b5c23-0888-4dc2-8352-b92e6db7eb55","year":2023},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.320603Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:fb14a99d729a66f66896dc9d5461f79952517e6f95ccf00bf920c48bc0f0e814","observation_id":"61b81311-cc84-437b-91f9-c8e6c963e082","resolution":{"observed_at":"2026-08-12T18:51:32.520390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-12T18:51:32.324016Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.324016Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:cd654e8d7b5f4e7cf812de69a55d8ccf339a5660f2928b4114b7165f852d0a10","observation_id":"409cab93-66aa-40f5-8c71-e07c99cb1ee7","resolution":{"observed_at":"2026-08-12T18:51:32.324016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:32.502161Z","title":"Tip- adapter: Training-free adaption of clip for few-shot classifica- tion","venue":null,"work_id":"6d654c6e-fa40-4918-8a64-d39018e68471","year":2022},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.327769Z"},"links":{"citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:ac851f22b58caaf201921fcd821ff4650fde566b52b56b90299e3a4d409c1945","observation_id":"93e7e4cb-bf08-40b8-9098-95b03725c978","resolution":{"observed_at":"2026-08-12T18:51:32.506560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10589","last_updated":"2024-10-14T15:00:55Z","snapshot_observed_at":"2026-08-12T22:23:40.736497Z","submitted_at":"2024-10-14T15:00:55Z","title":"MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10589","snapshot_observed_at":"2026-08-12T18:51:32.331261Z","title":"Mote: Reconciling generalization with specialization for visual-language to video knowledge transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:32.331261Z"},"links":{"cited_paper":"/paper/2410.10589","citing_paper":"/paper/2411.11223"},"observation_digest":"sha256:1c211b4da8fc3c478d9a80d598f48e261143afd61017a706a2e9ce90134045f4","observation_id":"7844c60d-ab71-4bc1-a07b-e8d458cbb83e","resolution":{"observed_at":"2026-08-12T18:51:32.331261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11223","last_updated":"2025-03-18T02:51:43Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:19:32.620617Z","submitted_at":"2024-11-18T01:25:58Z","title":"Efficient Transfer Learning for Video-language Foundation Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2411.11223."}