{"as_of":"2026-08-18T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d96fccd1ef552b16a0ab83e1943ffd336a9d43e8d7728730f0b55a19074cff30","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:35:56.191733Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12513/citation-record","integrity":"/paper/2504.12513/integrity","json":"/paper/2504.12513/citation-record.json","paper":"/paper/2504.12513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.961638Z","title":"Hiervl: Learning hierarchical video-language embeddings","venue":null,"work_id":"081efdd6-de11-44d2-8042-568764390a4f","year":2023},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.953474Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:cf4ebd04c6b614a2fada3cf091be58f15a9a97e4149d420f6749347421e9afbd","observation_id":"fe9c2dec-853d-4ac7-80c4-21ac84cb7edc","resolution":{"observed_at":"2026-08-16T12:35:56.966485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.946305Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"249d5ae7-3547-474d-bdee-2bb11ae0811f","year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.958717Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:1ae6198e490b2959fa498ffb919f8f134158aaf64784c715530eb885b099df13","observation_id":"0aef341b-cf31-4931-b3e5-5a06b043f0b8","resolution":{"observed_at":"2026-08-16T12:35:56.951522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05861","last_updated":"2024-05-31T15:22:58Z","snapshot_observed_at":"2026-08-18T08:53:22.413981Z","submitted_at":"2024-02-08T17:50:22Z","title":"Memory Consolidation Enables Long-Context Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05861","snapshot_observed_at":"2026-08-16T12:35:55.963796Z","title":"Mem- ory consolidation enables long-context video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.963796Z"},"links":{"cited_paper":"/paper/2402.05861","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:01fe8bad62408a874967c48d0291a75caceacb7de1d37a2ac3c442e30da398dd","observation_id":"44a795ac-f4d3-428b-b48a-d2a600b54f28","resolution":{"observed_at":"2026-08-16T12:35:55.963796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T12:35:55.969231Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.969231Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:f5c046481be5dd3a0a40badbc978e9605fa1a5fee3af665c2d43ddb14a0221ed","observation_id":"52cf30be-8cf9-44a7-9954-b313918114dc","resolution":{"observed_at":"2026-08-16T12:35:55.969231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.931514Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":"49d15c8a-aa7a-47c0-8088-e72eefb7c5a4","year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.974125Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:f0099d999b99bf2130074a14da788b69609596c10e51dcc784011309f570fadd","observation_id":"a9c3490f-ca98-4857-86ef-acff910beb61","resolution":{"observed_at":"2026-08-16T12:35:56.936390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.917110Z","title":"Flexivit: One model for all patch sizes","venue":null,"work_id":"e86a184e-a106-4c3b-8700-912b40e27558","year":2023},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.978854Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:3d162a7d07942f403b5f1cf184e46d57dfee9627404c465098994d377ccd566d","observation_id":"6e27c4bb-9e01-49fc-90e2-efccd3fd852d","resolution":{"observed_at":"2026-08-16T12:35:56.921806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09791","last_updated":"2020-04-29T20:49:05Z","snapshot_observed_at":"2026-08-14T10:59:14.094474Z","submitted_at":"2019-08-26T16:46:23Z","title":"Once-for-All: Train One Network and Specialize it for Efficient Deployment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09791","snapshot_observed_at":"2026-08-16T12:35:55.984188Z","title":"Once-for-all: Train one network and specialize it for efficient deployment","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.984188Z"},"links":{"cited_paper":"/paper/1908.09791","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:fc49940db0c51804833c597d48d6a888db02528cca441e05792009cfb475f460","observation_id":"f473e052-b15d-4cb3-b7c0-61d167d87e89","resolution":{"observed_at":"2026-08-16T12:35:55.984188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.902443Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"fc9229fe-06d0-4b44-bc2b-758458d6501b","year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.989080Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:059c45ef0769f9ce6ecf37153ae79d01c88a2a6187e0034b4144c43cd5574124","observation_id":"824ac077-966e-42ea-be87-e6d81d372349","resolution":{"observed_at":"2026-08-16T12:35:56.907252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.888068Z","title":"Vision transformer slimming: Multi-dimension searching in continuous optimiza- tion space","venue":null,"work_id":"194ab2d1-b246-45dc-85c5-ffabfa6c5793","year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.993662Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:fb7f3fd0518de1a6053ac8fb4239effc7cb01c4409244fd919ab32f7388af8e4","observation_id":"096fdd9b-bd77-4d49-a29c-37af99143617","resolution":{"observed_at":"2026-08-16T12:35:56.892774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01543","last_updated":"2017-11-13T19:44:32Z","snapshot_observed_at":"2026-08-18T20:40:52.483707Z","submitted_at":"2016-12-05T21:04:17Z","title":"Towards the Limit of Network Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01543","snapshot_observed_at":"2026-08-16T12:35:55.998203Z","title":"To- wards the limit of network quantization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:55.998203Z"},"links":{"cited_paper":"/paper/1612.01543","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:e57ee63782ff5a4c5e0e540b38dae34932017c5ccaa42b52f4c4b8ef59f570c3","observation_id":"0722223b-cbd0-402f-97d8-b8f9f094dccf","resolution":{"observed_at":"2026-08-16T12:35:55.998203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T12:35:56.003372Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.003372Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:65d4648f895e2e275f9944e93c2669a7629afd882cac50e85116b8c27e76cf31","observation_id":"05a3fe94-49c0-4002-826b-fe1afda5c235","resolution":{"observed_at":"2026-08-16T12:35:56.003372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.872584Z","title":"Matformer: Nested transformer for elastic inference","venue":null,"work_id":"a6d02bba-9725-4d14-952d-3923e0b07451","year":2023},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.008261Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:604a231bac2844efafaaa04b422097fbaaaeea97345d0cbc66b59232abcb1fb1","observation_id":"440cb46e-30f8-4f78-8fa4-889d3d75a44a","resolution":{"observed_at":"2026-08-16T12:35:56.877891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.856264Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"1235bc04-bb10-4084-bb1b-dd66f9a2c55e","year":2019},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.012750Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:ca176901799760325b7b055666a66b7bcafcfd701d6b8110112bd5ec608adc30","observation_id":"77641918-6f5d-471a-85c3-986fcb0da2e0","resolution":{"observed_at":"2026-08-16T12:35:56.861335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.841714Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"4559aaa3-f88f-4587-9236-70f282f19d8b","year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.017739Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:01d782883ab116613a68c600e60d3fd66d3647b9410b6d4dc597a1d12f06216e","observation_id":"05e8a850-a9b9-4757-bc7a-853394a9cc16","resolution":{"observed_at":"2026-08-16T12:35:56.846268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.827406Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"91247db7-7f92-4a9f-96d8-ed39b31fad3a","year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.022435Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:e351e346eb7213dc6eef453b0c5e2b571e7c041996b727b4956cbc4b97c9d627","observation_id":"e3809cd4-506c-4386-91d2-8d6271a610d4","resolution":{"observed_at":"2026-08-16T12:35:56.832277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.813487Z","title":"Dynamic convnets on tiny devices via nested sparsity","venue":null,"work_id":"4f53d956-163d-428f-a5cd-d84365ffa623","year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.026815Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:6bd51ac4ebf984c8dcd509adb1cd624987d914c0560ddfb4ab19697bb01f9bb1","observation_id":"da3a14b4-915a-41bd-924d-3e905235e210","resolution":{"observed_at":"2026-08-16T12:35:56.818036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07324","last_updated":"2022-05-15T16:23:30Z","snapshot_observed_at":"2026-08-16T17:00:12.400266Z","submitted_at":"2022-05-15T16:23:30Z","title":"Transkimmer: Transformer Learns to Layer-wise Skim","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07324","snapshot_observed_at":"2026-08-16T12:35:56.031204Z","title":"Transkimmer: Transformer learns to layer-wise skim","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.031204Z"},"links":{"cited_paper":"/paper/2205.07324","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:dcc40f6feb13f5741ab478379ee6b725641448276df068d49a2a31cdd8351b2a","observation_id":"bcaa72c8-997d-445c-8839-ea0a049f07a6","resolution":{"observed_at":"2026-08-16T12:35:56.031204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T12:35:56.035899Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.035899Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:68e3b7f0c54096c86e12734978e2942242a5118c2f96e7436fb6974e755c34db","observation_id":"fccdba26-2254-439b-892c-2250a6d5162c","resolution":{"observed_at":"2026-08-16T12:35:56.035899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-16T12:35:56.040813Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.040813Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:4fcff83d5bd97eb4fa3409b01164e57d8eace917123ec35f3c66ed4f72fc3257","observation_id":"4640f7b3-90cc-446e-8e9c-ce294c95de7e","resolution":{"observed_at":"2026-08-16T12:35:56.040813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.799449Z","title":"Dynabert: Dynamic bert with adaptive width and depth","venue":null,"work_id":"37a8f21d-9fb7-41c4-84d7-43a28c53829e","year":2020},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.045191Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:9822191ffb4a151a6f6da951d3601fe6e3af47b57dd7dca92cb45b1572e3130f","observation_id":"10756d83-cb59-4617-841a-a84c00ef0b31","resolution":{"observed_at":"2026-08-16T12:35:56.804032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.049562Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.049562Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:8d1f3b2a3ab01230c0cf86a5b9e038d32e8c0682dc98d86ad93d89b21d3faaf6","observation_id":"7a036d8c-987c-43d3-a4b4-52b26a4e5795","resolution":{"observed_at":"2026-08-16T12:35:56.049562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13250","last_updated":"2024-05-16T12:23:05Z","snapshot_observed_at":"2026-08-16T14:16:50.800174Z","submitted_at":"2024-02-20T18:58:54Z","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13250","snapshot_observed_at":"2026-08-16T12:35:56.054262Z","title":"Video re- cap: Recursive captioning of hour-long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.054262Z"},"links":{"cited_paper":"/paper/2402.13250","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:d5f5cb612384bcdf80d8a17bb967f93b94cb2f01573142a6f682827a45d40aaf","observation_id":"3fbb887f-d92d-485c-ab64-82a673efe4b0","resolution":{"observed_at":"2026-08-16T12:35:56.054262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-16T12:35:56.058930Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.058930Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:8d5424986529f5cf34d9e6c64abb36da17608b5b5685a90fa41e4ba40d965fdb","observation_id":"d14186c5-df10-40b1-a9b3-05541d0585c1","resolution":{"observed_at":"2026-08-16T12:35:56.058930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.775483Z","title":"Matryoshka representation learning","venue":null,"work_id":"a6811ae8-1e91-4454-b9c3-8f1b29755f55","year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.063785Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:5e4fb16732c098d15119ee8ccc1baf4de39a2304352577360a7d85551df817a8","observation_id":"0615abc7-7681-4708-a7c2-e681c661cba4","resolution":{"observed_at":"2026-08-16T12:35:56.780186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04838","last_updated":"2021-09-10T12:46:32Z","snapshot_observed_at":"2026-08-16T17:57:33.300507Z","submitted_at":"2021-09-10T12:46:32Z","title":"Block Pruning For Faster Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04838","snapshot_observed_at":"2026-08-16T12:35:56.068793Z","title":"Block pruning for faster transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.068793Z"},"links":{"cited_paper":"/paper/2109.04838","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:b81506199e5d5bd0ab37b98492f11caeffa858a8a6d93832db1bd87c537e75e1","observation_id":"c354b6f8-641f-409a-b30b-0c17bbe8b3ee","resolution":{"observed_at":"2026-08-16T12:35:56.068793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.760159Z","title":"Resound: Towards action recognition without representation bias","venue":null,"work_id":"ffa69be0-61ca-4deb-bf12-a37d99f4d981","year":2018},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.073483Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:0424613b88b278719ecc45cbe4d3b98c6567084b1eadf64a5f47c48187547659","observation_id":"cc3b5e32-5c90-4b00-be4f-a08a413218d0","resolution":{"observed_at":"2026-08-16T12:35:56.765223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01670","last_updated":"2022-10-13T03:31:05Z","snapshot_observed_at":"2026-08-16T16:55:28.178235Z","submitted_at":"2022-06-03T16:28:58Z","title":"Egocentric Video-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01670","snapshot_observed_at":"2026-08-16T12:35:56.078363Z","title":"Egocentric video-language pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.078363Z"},"links":{"cited_paper":"/paper/2206.01670","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:4a9d0afdc70fdc9ff810a934161f98421c3559a02931b42d2d0e297e237bc9fb","observation_id":"ae65ca19-72ad-4e95-bdf9-61c8ab151262","resolution":{"observed_at":"2026-08-16T12:35:56.078363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.744799Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"7f65813f-f363-4881-8306-33f90110604f","year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.083071Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:dd5f203a66364291c2a8a95a68be0ec0845cabbb910d9117c5b35744225f3b5f","observation_id":"ce75f7db-64a8-4ce0-9e2e-526e496bf87d","resolution":{"observed_at":"2026-08-16T12:35:56.749579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05270","last_updated":"2019-03-05T05:58:11Z","snapshot_observed_at":"2026-08-14T18:15:55.919265Z","submitted_at":"2018-10-11T22:15:28Z","title":"Rethinking the Value of Network Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05270","snapshot_observed_at":"2026-08-16T12:35:56.087445Z","title":"Rethinking the value of network pruning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.087445Z"},"links":{"cited_paper":"/paper/1810.05270","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:e714cddb91bce1bc43a73e6585dfe71995543f0687ba702d4ac34fd3bd27450b","observation_id":"c51ad084-7082-426e-b1d4-73f91270ff0b","resolution":{"observed_at":"2026-08-16T12:35:56.087445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T12:35:56.092058Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.092058Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:c20b1a72b78b006a998b287746523f747f68efd4f43243f37527fddc54f45c4f","observation_id":"b0d0ef6f-8449-4594-a162-77d548a1b18a","resolution":{"observed_at":"2026-08-16T12:35:56.092058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-16T12:35:56.096502Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.096502Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:373a19eaeea5b7ec6818ceecef2163e39ca51485f6a3b538ef8163454ccbc60e","observation_id":"d2053245-e3a9-4b9c-93a3-30288afa8d6e","resolution":{"observed_at":"2026-08-16T12:35:56.096502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.730399Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"d4e71e05-2bbf-42a3-b614-9a626b8cab41","year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.101319Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:8138d330b6a6fa1c7f725f2656346add7a1779bc977866336247d3e0c27150bc","observation_id":"87c13dce-107c-453e-8ca7-06937970a679","resolution":{"observed_at":"2026-08-16T12:35:56.735087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.715960Z","title":"Howto100m: Learning a text-video embedding by watching hundred mil- lion narrated video clips","venue":null,"work_id":"29d8030d-9c98-405a-8524-1ea12ca1cb5c","year":2019},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.105835Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:041cb43bce290178d7a47781dcb7c8ccc3bd0241c8819881325dbce742289433","observation_id":"d2b4998c-b90c-492c-baa6-b8160e4604e6","resolution":{"observed_at":"2026-08-16T12:35:56.720661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.701452Z","title":"End-to-end learn- ing of visual representations from uncurated instructional videos","venue":null,"work_id":"7e1e975a-7a3a-4689-b91e-da2bddbb3e33","year":2020},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.110318Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:b0831f3755467461ad8025c62296495fc16866c4dcca0472ae497142c9fa45f5","observation_id":"8a0b218f-5f8f-4904-8cf0-e37b93acfa7b","resolution":{"observed_at":"2026-08-16T12:35:56.706236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.686867Z","title":"A sim- ple recipe for contrastively pre-training video-first encoders beyond 16 frames","venue":null,"work_id":"976f4293-2cb0-4822-8939-f2eaaa0d42ca","year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.114688Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:19ae10938ceaa67b696f72b0111e01f16a4fb66a60e1c5e334b528cce80e6246","observation_id":"cc4a0554-9109-4996-9e89-d03841bb85ca","resolution":{"observed_at":"2026-08-16T12:35:56.691703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.119502Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.119502Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:40b628e67429cf0d94eb933f9b5f4cd6f211725293131032a0a165e51b79b13e","observation_id":"721ea63a-ec2c-4c0c-93db-3822f6387b3a","resolution":{"observed_at":"2026-08-16T12:35:56.119502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12126","last_updated":"2023-10-18T17:35:15Z","snapshot_observed_at":"2026-08-16T14:50:59.027670Z","submitted_at":"2023-10-18T17:35:15Z","title":"SHARCS: Efficient Transformers through Routing with Dynamic Width Sub-networks","version":1},"cited_work":{"arxiv_id":"2310.12126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12126","snapshot_observed_at":"2026-08-16T12:35:56.315084Z","title":"SHARCS: Efficient Transformers through Routing with Dynamic Width Sub-networks","venue":"cs.LG","work_id":"b94d34cd-2810-4f7a-9561-f3ae8635ce8a","year":2023},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.124027Z"},"links":{"cited_paper":"/paper/2310.12126","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:729b77d03fb176efb0f1e0ebc6668031b77c7e9987e74e842e34251a840f1f30","observation_id":"bc351f54-06a2-4124-a937-65c6e3239472","resolution":{"observed_at":"2026-08-16T12:35:56.322949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T12:35:56.128650Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.128650Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:3a732257ab650c11d5cf3122ee6bee32bf17e73e3b268cabd66648d6387e2ddf","observation_id":"a1a911d8-a3d9-4c5e-938e-8a01a045b54e","resolution":{"observed_at":"2026-08-16T12:35:56.128650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.663387Z","title":"Q- bert: Hessian based ultra low precision quantization of bert","venue":null,"work_id":"7cbb4d9b-77e1-4988-a891-e3cccd0eab63","year":2020},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.133416Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:07324050a8f7ae7f36cc4fa100e209e0d4cbd41e5d7ac296d22488ac851f5810","observation_id":"e87bcd01-65a0-40f3-874b-df2ac13f6d83","resolution":{"observed_at":"2026-08-16T12:35:56.668159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.647506Z","title":"Training data-efficient image transformers & distillation through atten- tion","venue":null,"work_id":"583f0208-c412-488f-94be-4829654ac040","year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.138106Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:898f00e7738a4766339997c51a0471bcf1980a1857c6e861e073cc1fd54bb49f","observation_id":"63612549-91f1-42c6-84b6-e2ea945978e7","resolution":{"observed_at":"2026-08-16T12:35:56.653140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.142606Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.142606Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:7b1027cdca7d730c770d647fe65ee43a9cda6390e4ef5ecf1476e9cff169dcfe","observation_id":"2f04f4e1-1728-4516-9703-d2657e51f998","resolution":{"observed_at":"2026-08-16T12:35:56.142606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.623913Z","title":"Deformable video trans- former","venue":null,"work_id":"22f678c1-21ef-4e4e-849e-032c2f08b78b","year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.147182Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:f61221f5ac407936b4244a573eecbd4ca6c5f7f3aa49187c20efff892f65a45a","observation_id":"d3a657a0-3aed-46bf-99ea-320548a525cc","resolution":{"observed_at":"2026-08-16T12:35:56.628578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-16T14:09:21.368307Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-16T12:35:56.151992Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.151992Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:4988adbefbdf17ce469140dd2358a13198b84992c6caf2c97fc33b624500d97d","observation_id":"24561286-af50-4f6d-a761-985ccb83a42c","resolution":{"observed_at":"2026-08-16T12:35:56.151992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-16T12:35:56.157243Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.157243Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:779a3535ac5c9087ed85b9e160d50737e13cadc3b5bac7a3fffadefc1e60d5d5","observation_id":"4c970475-6e73-41c5-a6db-0b8dcfacdd20","resolution":{"observed_at":"2026-08-16T12:35:56.157243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.162838Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.162838Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:2ebca9a0ac142e5d4610f6e71d9ffa07ed71af65849e3670ecac18719787e141","observation_id":"8060ef7f-6824-4eda-b5e7-a5e9ba352308","resolution":{"observed_at":"2026-08-16T12:35:56.162838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-16T17:53:18.213502Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-16T12:35:56.167427Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.167427Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:ec5d452ec3efef42822bb20d1a1838096f86dcd87ea4d1f0b946b7614f0f9a28","observation_id":"052cd404-e35f-47d8-b9a3-ced47168b153","resolution":{"observed_at":"2026-08-16T12:35:56.167427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08928","last_updated":"2018-12-21T03:36:48Z","snapshot_observed_at":"2026-08-14T17:40:05.995607Z","submitted_at":"2018-12-21T03:36:48Z","title":"Slimmable Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08928","snapshot_observed_at":"2026-08-16T12:35:56.172291Z","title":"Slimmable neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.172291Z"},"links":{"cited_paper":"/paper/1812.08928","citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:bbf0f9a15b112644ada55c1fea4a148767a896a69163753f35bdb44b1162699b","observation_id":"c6b921f7-1817-4f60-b8c9-178b349f5c63","resolution":{"observed_at":"2026-08-16T12:35:56.172291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.177310Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.177310Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:cf0b778451fd231f66d175245c960f75573a353ab80e02aa2fe8013cd060fc0a","observation_id":"c19320ce-cf02-4109-856d-7fe29833806a","resolution":{"observed_at":"2026-08-16T12:35:56.177310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.590377Z","title":"Poa: Pre-training once for models of all sizes","venue":null,"work_id":"a78beb0c-b91e-4834-aa53-cf69f9e9eff0","year":2024},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.181965Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:0ad24bd11cb0fe9bfb91fe2ca98609ded79fdcde8de5b67bc2ec788cec2418f5","observation_id":"5739293f-3212-42ca-a1a7-c8fe5a48e90b","resolution":{"observed_at":"2026-08-16T12:35:56.595138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.186656Z","title":"Mgsampler: An explainable sampling strategy for video ac- tion recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.186656Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:02fb875fb5475e8abd0fe5796f2e680d31566bf111f6dc9d61a269f16c8c458b","observation_id":"d9093c44-da05-4731-ab8f-e1582d8778d9","resolution":{"observed_at":"2026-08-16T12:35:56.186656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:35:56.566274Z","title":"FLOPs computation A.1","venue":null,"work_id":"19f2968c-6819-4ba3-b511-7eca81308054","year":null},"citing_paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T12:35:56.191733Z"},"links":{"citing_paper":"/paper/2504.12513"},"observation_digest":"sha256:5eb9eda0b92c343b20f4d4d82f6a3e0d75e4923a386f1fd405c80bd92729e24b","observation_id":"907ccd42-b7ab-41b0-88fb-8defaf1949d5","resolution":{"observed_at":"2026-08-16T12:35:56.571000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12513","last_updated":"2025-04-16T22:19:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:48:03.233675Z","submitted_at":"2025-04-16T22:19:50Z","title":"AdaVid: Adaptive Video-Language Pretraining"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2504.12513."}