{"as_of":"2026-08-13T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d93812fca386df6db5e0ba68041c43aad2b813dc40c71f53759aa5555d4f78f","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:13:04.420943Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11228/citation-record","integrity":"/paper/2412.11228/integrity","json":"/paper/2412.11228/citation-record.json","paper":"/paper/2412.11228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.033324Z","title":"The youtube video recommendation system,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.033324Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:be2d3b41c92abf6e05cc33fbd1582e4082ef32b404c1260cf5cf3f6ec134d76c","observation_id":"ee69c092-f209-4729-8774-6571b583892c","resolution":{"observed_at":"2026-08-11T15:13:04.033324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.038183Z","title":"Content-based video recommendation system based on stylistic visual features,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.038183Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:03345b3bb08a7223777cb2f1e4f5ba54b0ef81535fa1df87bf63606e7053461b","observation_id":"17bcd798-c462-4af3-89fb-80a3201f2bf6","resolution":{"observed_at":"2026-08-11T15:13:04.038183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.042811Z","title":"A unified personalized video recommendation via dynamic recurrent neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.042811Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:b133e4a07529a49bb854fdb66c31eb7bb87355c28967828d5ac5ecaf52d6adc0","observation_id":"67240e45-3801-4fb0-9f43-98eea11f0440","resolution":{"observed_at":"2026-08-11T15:13:04.042811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.046773Z","title":"A system for video surveillance and monitoring,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.046773Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:ab4f0a8d3f8cba2776c26e59133fe844f4b36f2c58e15fbc5414f1c38a9bddba","observation_id":"2ff0a395-4dff-4fd0-9414-73786b06b464","resolution":{"observed_at":"2026-08-11T15:13:04.046773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.050924Z","title":"Distributed deep learning model for intelligent video surveillance systems with edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.050924Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:94562937ff5b9d969e9012246102ac20ffca6ae5716d738130f39d5f08037f72","observation_id":"59c75ff5-ac8d-4d53-b7dd-4713190f6af2","resolution":{"observed_at":"2026-08-11T15:13:04.050924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.054753Z","title":"Searching video for complex activities with finite state models,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.054753Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:ed4d86ddbc4cc719afa9ec2130b038c60ea103bc0c0721ebdc00ab0d120afb25","observation_id":"83530c02-eb62-4c4f-82f5-49b2d2a27214","resolution":{"observed_at":"2026-08-11T15:13:04.054753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.058651Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.058651Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:acdd75006a6cbac21f9567020b9bc5680c95add1b23973ace15b77c34c8146dd","observation_id":"86c690d0-4c2f-4ffd-8ddd-fec1fd8983c6","resolution":{"observed_at":"2026-08-11T15:13:04.058651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.062223Z","title":"Deep feature flow for video recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.062223Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:7c241772a2cec549940d2f5a9b6aa585659a2b895614b32fba04e50694d9bded","observation_id":"7024496e-9777-4bab-b8a2-3a4ae916ed7d","resolution":{"observed_at":"2026-08-11T15:13:04.062223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.065650Z","title":"Convolutional two- stream network fusion for video action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.065650Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:5765fc8f44f434d40d128a50d38db5b26ece0f325780bd8206102bbb41a24755","observation_id":"16464f36-6bf5-43c8-bb8c-587e955b8111","resolution":{"observed_at":"2026-08-11T15:13:04.065650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.069159Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.069159Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:9ca7572d8d1923fa2a36cfd7ff861769daefc7baa58b9248485c406b97f3c7d2","observation_id":"32581267-a390-4312-b0ca-5b935d540ceb","resolution":{"observed_at":"2026-08-11T15:13:04.069159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.072887Z","title":"Learn- ing spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.072887Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:adace0ea6356d72d242d830665a180b7e59f9236a3dd472dedabac85e8fcef67","observation_id":"a5a8d62a-58aa-41bd-9999-5a17e0ad583a","resolution":{"observed_at":"2026-08-11T15:13:04.072887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.076315Z","title":"Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet?","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.076315Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:42f034c0260b38e5dc95be26791c606733df67c929d229e132b09511e2e23339","observation_id":"7f7009b6-d49b-401b-8cce-c04ea8d02f55","resolution":{"observed_at":"2026-08-11T15:13:04.076315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.080290Z","title":"Liteeval: A coarse- to-fine framework for resource efficient video recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.080290Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:af6870cbedadf6fdf4ce81ce1b5a6c35b1c42ba9c083d3423b1d9048f364af26","observation_id":"2ba222c3-d250-462f-a094-b44e0e486e27","resolution":{"observed_at":"2026-08-11T15:13:04.080290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.084277Z","title":"Multi-agent rein- forcement learning based frame sampling for effective untrimmed video recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.084277Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:f3f59c80d8d798cec682effddcc6e285a5ed0c79c07b9c553c0b1c78908e4379","observation_id":"8199ae95-3bdc-469f-aad4-18b4ab80d9f0","resolution":{"observed_at":"2026-08-11T15:13:04.084277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.088611Z","title":"A dynamic frame selection framework for fast video recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.088611Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c22c070cfb85b84bf4b255508d1387fe81c88729cad12be5a7f254b613a106eb","observation_id":"ba5d9e32-4134-41d1-a0a7-09876e9b7bec","resolution":{"observed_at":"2026-08-11T15:13:04.088611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.092861Z","title":"Scsampler: Sampling salient clips from video for efficient action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.092861Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:405e8e1506624900ee34f04ad727de983e2bb393137e677d4eb3adb827a7137c","observation_id":"edd45991-434d-43ac-90d7-5ea7f78620c6","resolution":{"observed_at":"2026-08-11T15:13:04.092861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.097044Z","title":"Listen to look: Action recognition by previewing audio,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.097044Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:4aea4a36d8bb11cd91aad378674a1fa50836ac3b69a3efdc170a718f5d90c177","observation_id":"49073e31-c6d9-45e3-85fb-f407bb1482b3","resolution":{"observed_at":"2026-08-11T15:13:04.097044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.101259Z","title":"Ar-net: Adaptive frame resolution for efficient action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.101259Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:9e533afb47a47bc92e5ec9288e6530a2a447ec0f738abe6a74db4b9d04d667cb","observation_id":"257b296e-694c-4f25-abdc-ec69ed0362d5","resolution":{"observed_at":"2026-08-11T15:13:04.101259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.105683Z","title":"Ocsampler: Compressing videos to one clip with single-step sampling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.105683Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:3d010917ef21d6a50ca94ef9bfc7a88b8685d919ede447ceb463da5a2a48c47f","observation_id":"f9ede248-d690-4760-9659-f7097834426b","resolution":{"observed_at":"2026-08-11T15:13:04.105683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.109591Z","title":"Recurrent models of visual attention,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.109591Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:76f3b0e7d5ca724c131bdcfba726c25954f05994703477d6c51296ac80df6dd3","observation_id":"887306bf-c609-4b3d-b0b2-1f25b394a0d0","resolution":{"observed_at":"2026-08-11T15:13:04.109591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.113860Z","title":"Look closer to see better: Recurrent attention convolutional neural network for fine-grained image recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.113860Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:7e3ba76a723751267bbb04a0521570cbffa2a7c0ff6509c6d3ec647123cd8cb3","observation_id":"6877945c-2c95-49bb-a5b0-854dd9065392","resolution":{"observed_at":"2026-08-11T15:13:04.113860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.117591Z","title":"Spatially adaptive inference with stochastic feature sampling and interpolation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.117591Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:8f37bf913f9553c415f7ded767d83daf877bdcd5be036b8d5f510ba9a6701572","observation_id":"a186cd7c-45b9-4cf3-a441-a20fe5fe3d07","resolution":{"observed_at":"2026-08-11T15:13:04.117591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.121176Z","title":"Dynamic neural networks: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.121176Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:be55933388d9386680e13615c91126272db7a7fdb638cd4f0e23105a1de5fc65","observation_id":"b4259aeb-c9fc-49cd-b53c-9aa11e3d1e91","resolution":{"observed_at":"2026-08-11T15:13:04.121176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.125185Z","title":"Glance and focus networks for dynamic visual recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.125185Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:0665ae4f77178c95c8209829497903f774f430951f2084a4d6db2302ca4e240d","observation_id":"ea90a582-9d19-4f04-9bc0-73f817c5a28c","resolution":{"observed_at":"2026-08-11T15:13:04.125185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.129095Z","title":"Dynamic spatial sparsification for efficient vision transformers and convolutional neural networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.129095Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c6af84f478f2c60dcdf1881c9c0be5f046c8c8ba372f1e9e0bea3d3e2374c883","observation_id":"76476764-0631-4c62-9de0-177d5781d2ad","resolution":{"observed_at":"2026-08-11T15:13:04.129095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.132859Z","title":"Tsm: Temporal shift module for efficient video understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.132859Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:ae00b45cad68aa3b9ff7b95c9f57d3ae9a1be09e8d8bd1e1ae9c429a30bd0835","observation_id":"02b5e970-70d8-452c-bd3e-b3e152f94e0d","resolution":{"observed_at":"2026-08-11T15:13:04.132859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.137515Z","title":"X3d: Expanding architectures for efficient video recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.137515Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:358362f71ce2cb8ce1578284e077131c67824554d342a5ccc4dfc88990387628","observation_id":"5c53cc6d-1a4a-493b-8690-49dd92f280fe","resolution":{"observed_at":"2026-08-11T15:13:04.137515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.141341Z","title":"Adaptive focus for efficient video recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.141341Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:6534827edbc88ff62102f3cf0aebc9a4096e2185349f5382c1e1ca12b7532168","observation_id":"0606d5ed-99e5-4ffb-8c48-f9cb14bdea02","resolution":{"observed_at":"2026-08-11T15:13:04.141341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.145405Z","title":"Adafocus v2: End-to-end training of spatial dynamic networks for video recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.145405Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c87dd487c91fe2cab66ae22e6290b3c33b99e52d3751e97cf5a0815a5517ccdb","observation_id":"92bc39ed-a569-43b9-ac0a-ba6792315a0d","resolution":{"observed_at":"2026-08-11T15:13:04.145405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.149600Z","title":"Adafocusv3: On unified spatial-temporal dynamic video recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.149600Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:71633e80ca3d15006e7ff36a4090c390f74b8a95a66ce2692dbffd9efa6f3a10","observation_id":"e51c1fa9-4a6a-4c7b-b3bd-20967d4dc7c3","resolution":{"observed_at":"2026-08-11T15:13:04.149600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.153857Z","title":"Activitynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.153857Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:36a291244fd10b8408c35c3c149209a57222e30ebb4a44861115ef4d99ba197d","observation_id":"b761353c-05ad-4df6-b27e-a68e188593c9","resolution":{"observed_at":"2026-08-11T15:13:04.153857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.157685Z","title":"Exploiting feature and class relationships in video categorization with regularized deep neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.157685Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:56f4de17b0187c0ea3b21c7c70ab8bc0b0b68b85fae8603ae6471f3ab868d16e","observation_id":"120537fc-d2dd-450d-a60f-c2ea9ecbb57f","resolution":{"observed_at":"2026-08-11T15:13:04.157685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T15:13:04.161574Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.161574Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:9283e2e0429609987ac4969b713e0f72063f6998038545ee6c474a90ebf737dd","observation_id":"e455f3ef-f987-41d7-9f7b-dca5c9950f0f","resolution":{"observed_at":"2026-08-11T15:13:04.161574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.165962Z","title":"The \"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.165962Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:346a4bcce9b49766b223ff53473c217487a40802e8cf667f0070aa3e264dc186","observation_id":"ebc5312d-c7bf-40c3-814a-b48c901c2d24","resolution":{"observed_at":"2026-08-11T15:13:04.165962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.170113Z","title":"The jester dataset: A large-scale video dataset of human gestures,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.170113Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:7e651c7f6f4493e5f2183627d556ccfea6661da5d090705d5dbe70a6818c29d5","observation_id":"942d1591-27bf-468f-8a05-3665b83e0d88","resolution":{"observed_at":"2026-08-11T15:13:04.170113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.173782Z","title":"Temporal segment networks: Towards good prac- tices for deep action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.173782Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:de4dba6b640953fa1a54a588030cf1337e63b842ae51a7c9a1eb68e593cfab2b","observation_id":"1fe5fd39-bb1a-4fc7-8b0e-d6352305c9b0","resolution":{"observed_at":"2026-08-11T15:13:04.173782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.178055Z","title":"Long-term recurrent convolutional networks for visual recognition and description,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.178055Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:dd7d5dee4fba0cd4046eb2c6e9cd5893c9a91e16e11688b9eaea33e6eb1f3401","observation_id":"b595a528-1fef-4f49-83a7-cdc5e92a5bc7","resolution":{"observed_at":"2026-08-11T15:13:04.178055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.181851Z","title":"Recurrent tubelet proposal and recognition networks for action detection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.181851Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:8b844d5bb9ce89073319cbe35cc6822cb4c2540deed3a86610fd7fc486aac956","observation_id":"1e1a6e66-c2d8-453e-b60c-d30bf93fd49c","resolution":{"observed_at":"2026-08-11T15:13:04.181851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.185383Z","title":"Beyond short snippets: Deep net- works for video classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.185383Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:51ded1307238fb7ce806cd7adfbe52623e45fb64ec839b7e3ee668f95d47b5b3","observation_id":"25ce5452-f641-4535-a0dd-fae92b32d3a6","resolution":{"observed_at":"2026-08-11T15:13:04.185383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.188575Z","title":"Gate-shift networks for video action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.188575Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:bfcd130cb9746eaad9a6a833a0cfc41f1b4c589594ff22ed09035862db1377d6","observation_id":"10d6a03c-31e4-4b78-a312-e94414bcb166","resolution":{"observed_at":"2026-08-11T15:13:04.188575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.191751Z","title":"Adafuse: Adaptive temporal fusion network for efficient action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.191751Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:7ed71c305b2438fa20d614a3e04bfda325c77665d95d08290a8822a857e52055","observation_id":"8828fd6b-00af-447d-8596-0639b840ac28","resolution":{"observed_at":"2026-08-11T15:13:04.191751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.194866Z","title":"Spatiotemporal multiplier networks for video action recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.194866Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:089ae33e81bb07ab1d9e7318669535ae09560ee0fa17a388c065aa522f3184a9","observation_id":"9e4420a3-fe93-4e36-b275-be81ddb3abc1","resolution":{"observed_at":"2026-08-11T15:13:04.194866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.199621Z","title":"Searching for two-stream models in multivariate space for video recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.199621Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:386008db4875539ce9ba69d36485955f5d6047107bdccb020ba7221519c861e0","observation_id":"be1c474c-5a90-4935-8fc6-ec395d917566","resolution":{"observed_at":"2026-08-11T15:13:04.199621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.203023Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.203023Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:91521a0a32a9e25b518e34f454d26367e8b1f210e1dd3dbd6d7c9324c572745a","observation_id":"34b8a736-7dd7-4f92-a13b-2606591972d9","resolution":{"observed_at":"2026-08-11T15:13:04.203023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.206428Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.206428Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:8fc38d9a141bb1c13f072dd6f6cd9bc38473d3097158814955c4512f4981568f","observation_id":"05a33649-efbe-4913-b24c-da2faab3fbc0","resolution":{"observed_at":"2026-08-11T15:13:04.206428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.209828Z","title":"Video swin transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.209828Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:e1d1caf0a2562084ab7db797ed17fda01ed8ae460ba23bc236b529a30ff04e58","observation_id":"08fa2961-c0fc-4bdc-a6dc-dbd2eae4f743","resolution":{"observed_at":"2026-08-11T15:13:04.209828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.212962Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.212962Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:8c00ea591fcc68e04b0aad1716eb128ac9637eb0f2a7efe2678701ae423645cc","observation_id":"6e776662-972a-4abd-a459-fa8e758658ac","resolution":{"observed_at":"2026-08-11T15:13:04.212962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.216546Z","title":"Video transformer network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.216546Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:98324475cdb0c27c8ef6beae7c1fee9539bb461caeebb90d381f9e19adf6f778","observation_id":"7768dda2-03df-4d8a-8c79-a8332b67f6ba","resolution":{"observed_at":"2026-08-11T15:13:04.216546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.381987Z","title":"A closer look at spatiotemporal convolutions for action recognition,","venue":null,"work_id":"347f88c1-6056-479f-95b9-f2d97d0f2727","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.221273Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:0cf3530e9fc0d460ff3026f00cc380061f104e9682fd7bb1a11e33d5fffe97dd","observation_id":"7cb709c0-f1c8-4017-a6ce-4b1fdafc4eb3","resolution":{"observed_at":"2026-08-11T15:13:05.385600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.372755Z","title":"Eco: Efficient convolutional network for online video understanding,","venue":null,"work_id":"27dba812-0393-4d4e-b9f3-3ccb96b7800f","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.225056Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:33c038e3bbc509bfa80e6f4f8ec968265bba0ca9cfb3cd379d64a40dd5135de8","observation_id":"94c004c4-5215-415a-8442-7756795afd7e","resolution":{"observed_at":"2026-08-11T15:13:05.375690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.362484Z","title":"Video classification with channel-separated convolutional networks,","venue":null,"work_id":"a413e22b-b7eb-40d3-8e45-012d9532e775","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.229186Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:d5d6a7e6b8ed0826ab87e601645c4ae9e6b21e756b6318e2017d4cb9801d266f","observation_id":"f9203d4d-3e9d-43db-8b55-b04b32dd55bd","resolution":{"observed_at":"2026-08-11T15:13:05.366258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.351709Z","title":"Teinet: Towards an efficient architecture for video recognition,","venue":null,"work_id":"926c6e33-fe8b-4811-b337-7339ad08e8cc","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.232876Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:3658df0236fce2c5bf2d3fcb6aca6a5b1167e0a1f3e215aef41fcfb09d231b3e","observation_id":"db7395b3-b2d0-4a75-9300-74681fc093a8","resolution":{"observed_at":"2026-08-11T15:13:05.355933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.339988Z","title":"Tam: Temporal adaptive module for video recognition,","venue":null,"work_id":"17107d7d-9877-43a9-95a6-1b248af23d29","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.237050Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:9bb78a0be3424c7ae28308e657937cc84427ca1473f749b2af49fa103a63231c","observation_id":"ab8fb1eb-aaed-4173-a47b-080305fb9d9b","resolution":{"observed_at":"2026-08-11T15:13:05.344046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.329687Z","title":"End-to-end learning of action detection from frame glimpses in videos,","venue":null,"work_id":"56f5215b-d638-4848-aaca-919f3c702ac3","year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.241777Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:5643edbbdbe071b6c0456a1252e3fd09314b1725a83477feec8e0ce30d52e954","observation_id":"9d8b70aa-d7ad-4090-b089-7fab46b318b2","resolution":{"observed_at":"2026-08-11T15:13:05.333333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.320833Z","title":"Frameexit: Condi- tional early exiting for efficient video recognition,","venue":null,"work_id":"9ead42f9-2764-4edc-956d-ff23b39fee39","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.245524Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:1db81413825e04d8f77eedd709c643572c1dfd7887d8bb9bedbadb0350295f85","observation_id":"d1cfdb0c-40c8-4c77-9bf0-6576bb259b2f","resolution":{"observed_at":"2026-08-11T15:13:05.323804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.311772Z","title":"Efficient action recognition via dynamic knowledge propagation,","venue":null,"work_id":"b729af45-513f-4c5d-b3fe-b2420d120239","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.249543Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:1d289269671ae7c1f38a76cc91990fb3c8f22f963332de166b5e823daff7b01d","observation_id":"b538b53a-235c-4e02-87c5-c031039a6e05","resolution":{"observed_at":"2026-08-11T15:13:05.314908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.301043Z","title":"Dynamic network quantization for efficient video inference,","venue":null,"work_id":"45678dfc-b478-4613-8f96-2d5593acb934","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.253361Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c81fa8ca58aaf6d61d96b21ad259a68c18ce79de2a49dc441c1cf4c9591c3e4e","observation_id":"9320492a-49fc-4ff4-bb44-43d65e5d73e0","resolution":{"observed_at":"2026-08-11T15:13:05.304842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.290209Z","title":"Nsnet: Non-saliency suppression sampler for effi- cient video recognition,","venue":null,"work_id":"3539bb4c-3426-48ac-bf83-85d8650f9d22","year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.257374Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:955b972968430e5b5f3b97050be80a96dd78dc6d27c4ad24261ebe6846dbac53","observation_id":"c2b22354-e7b6-427d-ade5-d114be391777","resolution":{"observed_at":"2026-08-11T15:13:05.293908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.279684Z","title":"Temporal saliency query network for efficient video recognition,","venue":null,"work_id":"f5f1ef30-12f9-4949-af4d-e21c0cb8173e","year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.265295Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:1e28c44824c908c386bd30e060eb354bb1a842e8d64456ddde20340bce215ba8","observation_id":"64728f50-fda2-4be9-85f8-017da047ad2b","resolution":{"observed_at":"2026-08-11T15:13:05.283479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.268441Z","title":"Spatial trans- former networks,","venue":null,"work_id":"454cd995-759a-42a4-b8e2-18396ded1eac","year":2015},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.269122Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c5ab6dfa8717a98f197ed5a0f35dc9e8b333e38eccadbd5a94f058b15b9177e1","observation_id":"5e59602a-a196-4ce0-ad13-999b47658cf9","resolution":{"observed_at":"2026-08-11T15:13:05.272484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.257940Z","title":"Sbnet: Sparse blocks network for fast inference,","venue":null,"work_id":"2f1bfa5a-935b-4025-839f-66ca3527bbc8","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.273405Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:fc46a86bb2ed1bde6c69cde7529b00d16ed796680c68a195ffb4775e428fdf1f","observation_id":"7c636865-86e3-4bbf-8a67-0f61da231e66","resolution":{"observed_at":"2026-08-11T15:13:05.261455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.246943Z","title":"Resolution adaptive networks for efficient inference,","venue":null,"work_id":"a11b28ca-e812-4a7a-8b04-0085d6802ed9","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.277051Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a13b6889fdde348b2e8ca2e9006355ae10fcd6508ae971b18a41c64d017eefa5","observation_id":"43488e94-0c21-4556-b67d-e356c76833a8","resolution":{"observed_at":"2026-08-11T15:13:05.250627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.236075Z","title":"Adaptively connected neural networks,","venue":null,"work_id":"e5ceb989-75c9-409a-a3c4-0da9bf840ad3","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.280921Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:bad489afb25618bffc1a74693a51122541c719496227fcbc3f80605874c39d34","observation_id":"ac7eb3e9-7623-49bf-ac92-6ffe57f6aebe","resolution":{"observed_at":"2026-08-11T15:13:05.239658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.224906Z","title":"Dynamic region- aware convolution,","venue":null,"work_id":"594037ac-bdce-4280-823f-d86af4df2c0f","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.284776Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:9ce2729a305daa4f97b17885e3466f45cf3e39be1925ab451dd6d4abf5457dd2","observation_id":"5f6ed2eb-d692-4a4b-8aaa-61d80bafc759","resolution":{"observed_at":"2026-08-11T15:13:05.228964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.213036Z","title":"Spatially adaptive computation time for residual networks,","venue":null,"work_id":"7c607b9f-af19-4773-a82a-026415b17ac6","year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.288666Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:fd798d6ce30d7624e434fbc2367757fe9857a920b5152a8f1427211c1bd8cc54","observation_id":"15c89fd9-e7da-4407-86ea-4c19f35d844d","resolution":{"observed_at":"2026-08-11T15:13:05.216950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.202507Z","title":"Dynamic convolutions: Exploiting spatial sparsity for faster inference,","venue":null,"work_id":"0ab3bc3f-624d-4eef-87f6-1d0e29976bd8","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.292327Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:68b66abcaaccd9d0b7aab60e8258a5abff84858456a1cf7fdf425ae0cef2ccde","observation_id":"98f9d874-1552-4eff-9b03-ba64b29c50c2","resolution":{"observed_at":"2026-08-11T15:13:05.205905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.192748Z","title":"Interpretable spatio-temporal attention for video action recognition,","venue":null,"work_id":"2ff83346-0e03-488f-8fe3-f9b1b43959cd","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.296413Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:409be770e931d82394a9de4f65543370caaa05824272638f0e06f68bb2397155","observation_id":"d9f22a98-774c-4bdf-8eb9-29654f688a18","resolution":{"observed_at":"2026-08-11T15:13:05.196149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.182872Z","title":"Generalized domain conditioned adaptation network,","venue":null,"work_id":"33e86162-5afb-46f7-a65b-44281692e58f","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.300170Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:efc5f275d86d36320b2cdee5878cf053148506d51e31824402924673b4510b2e","observation_id":"a064f1f9-101b-4dcf-9ea8-ddb1d1d33fa6","resolution":{"observed_at":"2026-08-11T15:13:05.186488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.172442Z","title":"Learning deep features for discriminative localization,","venue":null,"work_id":"107121b9-6a1d-48ba-94b9-0721f84d127e","year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.303985Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a603af9e17476d799f2b8af5fbcb3d54186944dc7b5ca0a7e31d70c10b0c33c4","observation_id":"92c099b4-b884-49f6-add0-b579a19a25ea","resolution":{"observed_at":"2026-08-11T15:13:05.176146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.307704Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.307704Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:2fdaf08b8c01fc57d32d42002b9fb839eeda6dbe90caf7e1f1a392b66ff3b096","observation_id":"3194015d-0d86-4322-93d1-79422d588c34","resolution":{"observed_at":"2026-08-11T15:13:04.307704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.312478Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.312478Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c470a621ed8347022859635a69ae9ba7a6bb4d14bf12c27bfe0c88a05e50487b","observation_id":"8cfe7599-f681-4569-a99b-f49434bad134","resolution":{"observed_at":"2026-08-11T15:13:04.312478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.147403Z","title":"Delving into details: Synopsis-to-detail networks for video recognition,","venue":null,"work_id":"5b7a5c7c-6774-4340-ae6b-33953365db6d","year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.316804Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c316390e6def3ba715692c8acf5bcaaba89e39c6db5e3af0f329994016b13cab","observation_id":"d62046a7-0547-40ea-b229-d2223e67c9e7","resolution":{"observed_at":"2026-08-11T15:13:05.151419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.321072Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.321072Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:2d11a566fa58cb2df151eb97cb6de6c3ac4df4226ed5b2e0a819be95ebdd236a","observation_id":"f8a2be75-6a17-410b-9dd4-216a4d2a0f01","resolution":{"observed_at":"2026-08-11T15:13:04.321072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.127533Z","title":"Learning phrase rep- resentations using RNN encoder–decoder for statistical machine translation,","venue":null,"work_id":"8e638177-3eb6-4173-b814-189e2ca9c2d8","year":2014},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.324329Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a7b8587f3858c231848115b96d0059b8ea6cbac52ba6108e4353077470f79a2e","observation_id":"82bff7d6-0180-4ca4-a2c9-c51005a9e9fa","resolution":{"observed_at":"2026-08-11T15:13:05.131843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-12T14:28:10.961989Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-11T15:13:04.327939Z","title":"Playing atari with deep reinforce- ment learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.327939Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:6f335fa5207343ce7a8a5f0db4b09f267c5157d00a6f183b74cfa49ac2326064","observation_id":"0afd22a6-34b7-4fac-aa20-80060df2f2c3","resolution":{"observed_at":"2026-08-11T15:13:04.327939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T15:13:04.331662Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.331662Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:95eab9e6ec53da5dd9f1048e87fb349fc996e805c893abe4caaca3a7fc32f573","observation_id":"4672c204-b333-432e-b490-f3220955bd47","resolution":{"observed_at":"2026-08-11T15:13:04.331662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.335165Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.335165Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:e2b3ddbe29f128775df33c3c09c8168f5f14b2c4b19297d34b0b757d03df0d76","observation_id":"c1435bb2-be3f-47a4-9442-5792d1be80f9","resolution":{"observed_at":"2026-08-11T15:13:04.335165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.109611Z","title":"Convolutional networks with dense connectivity,","venue":null,"work_id":"9f805fb6-0df4-43c8-99e4-ad4b08324f1a","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.338593Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:abe46b34d8cea991ca83f91402d1d6d8b301cdd79370d8d4c5a108fffaca911a","observation_id":"494a66e2-c7de-44ce-b174-11bfb4fff6aa","resolution":{"observed_at":"2026-08-11T15:13:05.113534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.098749Z","title":"Better mixing via deep representations,","venue":null,"work_id":"b61b1a71-7a97-4006-a95a-397316f757d6","year":2013},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.342904Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:16f29078d6fb7039664f4130e8da595c8bb29b55ba41bbf75ae4e18071a16588","observation_id":"82ff5d30-d05a-4fc0-9f7a-606bc3c9c6b4","resolution":{"observed_at":"2026-08-11T15:13:05.102735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.088456Z","title":"Implicit semantic data augmentation for deep networks,","venue":null,"work_id":"fe0e2c81-db78-4240-b8c3-d5cf5a4e4066","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.347011Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:61685e23b7946307a5f567aad4bfa31b52da7de9eb6c4daf62d8bc1bb39921d9","observation_id":"517f8c69-2d69-4873-be59-edc758c0f6cc","resolution":{"observed_at":"2026-08-11T15:13:05.092070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.077035Z","title":"Deep residual correction network for partial domain adaptation,","venue":null,"work_id":"e4e95c69-98b3-478c-9779-a24baaa4e9d3","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.350867Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:3fad7f2bcbcd6bc73c9f99564d177d1cdc8c2628abd317c762cdcef2fe5ac88c","observation_id":"4776ceca-c4b8-4e76-bcd2-1c24c4d7bba5","resolution":{"observed_at":"2026-08-11T15:13:05.080764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.066224Z","title":"Sepico: Semantic-guided pixel contrast for domain adaptive semantic segmentation,","venue":null,"work_id":"acecb2a0-9fbd-4d2e-91ec-4c8a54cab970","year":2023},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.354738Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a00662e0c1eb759f949647e2a824a86ee170e51a9519e7308050fff9bdf07f0f","observation_id":"7e5b665c-6509-49eb-9abf-3c64154fbba8","resolution":{"observed_at":"2026-08-11T15:13:05.069921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.056732Z","title":"Adapting across domains via target-oriented transferable semantic augmentation under prototype constraint,","venue":null,"work_id":"d33addc4-e453-4df1-9ade-8b7a9e54d1bf","year":2024},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.358680Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:618326070ebfe69a060d3dbf40913d9539e7d816cc4ea9f9e02b347c0194534a","observation_id":"7189af12-0794-445d-ab82-8387a1bcf405","resolution":{"observed_at":"2026-08-11T15:13:05.059953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.047187Z","title":"Multi-scale dense networks for resource efficient image classification,","venue":null,"work_id":"b58dd666-11c3-467d-b3b3-847fc336f95c","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.362734Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:880b88555977e5d52c157f977ad4a323b7bbabacd37e1bb3428183e2e63426a4","observation_id":"0c5d241c-6e87-4ce1-a4f8-e8a0e9515ce4","resolution":{"observed_at":"2026-08-11T15:13:05.050549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.037201Z","title":"Glance and focus: a dynamic approach to reducing spatial redundancy in image classification,","venue":null,"work_id":"42252336-afd8-4bdd-934c-ea20ac6a8a69","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.366480Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:126145cbe136b6af61c86b82e7187d91b928f23fa878ab255b9cd847232311c0","observation_id":"d53ece80-2b01-4f67-a71f-a8f13cd84088","resolution":{"observed_at":"2026-08-11T15:13:05.040636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.024848Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition,","venue":null,"work_id":"79357e34-830c-4654-bbc4-7a4528fda020","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.370192Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:168633625e901c9bbfef48d609ad8117db82ddad24e7ac01217c99e8f98d948e","observation_id":"c21710bf-78f6-4d6f-8d20-6a7e60537d3d","resolution":{"observed_at":"2026-08-11T15:13:05.029953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.011892Z","title":"Watching a small portion could be as good as watching all: Towards efficient video classification,","venue":null,"work_id":"200d9d7e-3e87-4a11-a6c8-2de7f6cc106e","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.373969Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:45a175c3d3f7e475109cc801d5c73f5d706c5da9ae177a1a59d54af290ae9a83","observation_id":"35393844-4304-469a-8e39-2ab8dc04e857","resolution":{"observed_at":"2026-08-11T15:13:05.016447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:05.000580Z","title":"Adamml: Adaptive multi-modal learning for efficient video recognition,","venue":null,"work_id":"7820fd87-737b-42c9-aa46-a637584f430e","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.377644Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:e396527c2d881f6333f50185fac5299944f9fff001aaf8d6a7db60c321ee2fb2","observation_id":"741cedcb-0dd4-4344-9a66-09c4185796eb","resolution":{"observed_at":"2026-08-11T15:13:05.004491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.988927Z","title":"Smart frame selection for action recognition,","venue":null,"work_id":"001d3b97-4c5f-4998-be59-57af15df0254","year":2021},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.381224Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a6c1ac4de1660ac7dfab2c64807790dd649f849e19b5e1f47a8be01f70273ce8","observation_id":"46d796a2-edda-468c-83d4-b9a83a4a737f","resolution":{"observed_at":"2026-08-11T15:13:04.993208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.977548Z","title":"Look more but care less in video recognition,","venue":null,"work_id":"fb366ba6-ff34-404b-9db4-0763e0e5908d","year":2022},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.384874Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:2a751283c23bda0cf9455e1315c97457a317b4edcf3cf6931d09f068e3b80e55","observation_id":"c2f84d8e-2e40-4bdf-893e-830444a471be","resolution":{"observed_at":"2026-08-11T15:13:04.981766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.966615Z","title":"Resound: Towards action recognition without representation bias,","venue":null,"work_id":"a37f6992-19f8-49b7-a65b-d0cf6ff1c026","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.388397Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:d9efaab498f2629210a93e33d8ea22a9fcc012edd61553387cc459914f087214","observation_id":"72c78005-9626-4aa9-8016-bf281019b0c5","resolution":{"observed_at":"2026-08-11T15:13:04.970419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.956161Z","title":null,"venue":null,"work_id":"fad6f736-bca7-479c-a3ee-d49ebfc4f0dc","year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.391580Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:e114834c77779d12fda97090adefcbe6e0123df3f395205183d4f2545188bab0","observation_id":"e2e42bab-2a57-44bb-823f-77880228d035","resolution":{"observed_at":"2026-08-11T15:13:04.959621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.944748Z","title":null,"venue":null,"work_id":"61c33778-5c19-4e70-b76f-0aa23d734331","year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.395226Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:e7e6c6f439e2136cf10fa888baf4b19d88f47be41d8c85078a972a083ad7b915","observation_id":"6e7e8019-cc82-41e2-bdb3-c057533a6d0e","resolution":{"observed_at":"2026-08-11T15:13:04.949139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.932625Z","title":null,"venue":null,"work_id":"9ec23343-7a8b-4920-a976-aa182c1e33e3","year":null},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.398757Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:8098a3e58cff047e486b1dbb51c08a35d9d323c0df1aa36c3f9432d67695bffe","observation_id":"b5a19aee-bfc6-415d-bc7d-15d2629af4a9","resolution":{"observed_at":"2026-08-11T15:13:04.937548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.923347Z","title":"Violence recognition from videos using deep learning techniques,","venue":null,"work_id":"abd814ea-6567-4125-be91-7dbcc515be16","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.402638Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:aabc87a27304718c68deaf5828fd9da742f36087ec62d540edc2a200ae36cf94","observation_id":"331fa065-9e32-40e7-88a1-c2e116d7adbc","resolution":{"observed_at":"2026-08-11T15:13:04.926458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.912573Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":"8f62a987-797e-4ae0-8065-b58a282680de","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.406007Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:2c9f4a9df8b57c26ae53aa3cbc622f599c1583ead429cdc06794598465ea9332","observation_id":"344b11ca-7f2e-4945-9eea-bf8b2e3e0435","resolution":{"observed_at":"2026-08-11T15:13:04.916834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.902430Z","title":"Videos as space-time region graphs,","venue":null,"work_id":"30384747-f03b-4bc5-be58-9a8cb973dbf5","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.409316Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:dc451cfa2929e28b136dece9b20a65a9fc52b498412f57c5f824bb50f4fe8839","observation_id":"fc8991ea-db14-40b9-9ed9-ad18ebd786d9","resolution":{"observed_at":"2026-08-11T15:13:04.905990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.891557Z","title":"Temporal relational reasoning in videos,","venue":null,"work_id":"fdc4976f-34dd-4769-8465-c4e622531939","year":2018},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.412730Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:c8509548a72851472625d8c0d23a171701fd182fc7e9e3b6fa63d67551fe49c4","observation_id":"29bd6d74-d020-4fdc-a3de-ac17194ec803","resolution":{"observed_at":"2026-08-11T15:13:04.895284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.880874Z","title":"Smallbignet: Integrating core and contextual views for video classification,","venue":null,"work_id":"410b8cd2-9806-4cfa-adec-30f60ea08e9a","year":2020},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.416609Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:4e6e0237309da99b6b8cbe549cb8f88af1ad62884b4b8e85d3f06778328c2bea","observation_id":"cecfdc96-184a-464e-8c20-5aaeb8251154","resolution":{"observed_at":"2026-08-11T15:13:04.884825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:04.868703Z","title":"More is less: Learning efficient video representations by big-little network and depthwise temporal aggregation,","venue":null,"work_id":"9c3158e6-e997-4b62-8c20-f23d3075cdc4","year":2019},"citing_paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T15:13:04.420943Z"},"links":{"citing_paper":"/paper/2412.11228"},"observation_digest":"sha256:a246ad5db44e2924c2feadd237455b018250360adb2c368a8f3354835fbac415","observation_id":"55acfacc-b213-4858-8360-23cb98f3cc71","resolution":{"observed_at":"2026-08-11T15:13:04.873079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11228","last_updated":"2024-12-15T15:51:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:52:09.579826Z","submitted_at":"2024-12-15T15:51:44Z","title":"Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 0 inbound Pith citation observations for arXiv:2412.11228."}