{"as_of":"2026-08-14T19:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fcb56841c590e60c905d9deaa45f299d457a6f362d3a893e02e743d54c627e3","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:38:09.895402Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13626/citation-record","integrity":"/paper/2411.13626/integrity","json":"/paper/2411.13626/citation-record.json","paper":"/paper/2411.13626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.102322Z","title":"Vivit: A video vi- sion transformer","venue":null,"work_id":"55d4852f-18b2-4af9-abba-463b47a44624","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.538275Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:349f92a1ababf4c9bf9a0ed5c9ea33ce96889f1ecb4dfdb6f7a6e92282c0df5d","observation_id":"5a99891b-2e49-4489-8005-51c9dc53d51a","resolution":{"observed_at":"2026-08-12T16:38:11.107604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-13T20:17:16.277117Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-12T16:38:09.546390Z","title":"Is space-time attention all you need for video understanding? ArXiv, abs/2102.05095, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.546390Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:3a0b9ad732297d2fba7b4a79c33db0b69cba734f2d93680c2673074e29bdfd62","observation_id":"c9348b78-6a67-4449-bb64-609cc30b4912","resolution":{"observed_at":"2026-08-12T16:38:09.546390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.554368Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.554368Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:c202f243cad24f42460f05c17f2bfa27db191a4adb157fb90680cdb3b0c768f0","observation_id":"49cabee7-aefe-4090-8476-4ad7f9bdc92f","resolution":{"observed_at":"2026-08-12T16:38:09.554368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.069418Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"20c880c4-aade-4858-92db-0805ce638019","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.561593Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:7c8ee01637be2fedd625fd6074fff2acebdc4e0e8f19164ab06f5af0dbaee106","observation_id":"81fd44e9-98bc-428e-9fa7-c3e18c494187","resolution":{"observed_at":"2026-08-12T16:38:11.075015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.043790Z","title":"Revisiting the” video” in video-language understanding","venue":null,"work_id":"d1c9556f-60fb-418b-a10e-959ddb9d8547","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.568188Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1be3725cb7fc525f905c82f42dd1a3838d7d40efef42c66f334583155972b220","observation_id":"42b7f1f4-3f60-4fac-a742-73a4fe5dc6ef","resolution":{"observed_at":"2026-08-12T16:38:11.052252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:11.024916Z","title":"Space-time mixing attention for video transformer","venue":null,"work_id":"66d1fe0e-1dcd-4210-b168-ea1f9ae8eaf6","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.584966Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:2b5c8e3f2e94a3757218f20b2f79d40022e780dd6f17538b4d1e856e14122f00","observation_id":"9651a4fb-f220-45f0-8ef8-75e05b8d0472","resolution":{"observed_at":"2026-08-12T16:38:11.031143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.595147Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.595147Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:fc3e938c3638d6a2c5cc2208b68827011a25a5ad5afc05ecd785bcc3b7168add","observation_id":"fabe6ce3-449a-4b92-b86a-857a4caa921e","resolution":{"observed_at":"2026-08-12T16:38:09.595147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.995344Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"b43357bf-5133-4491-88ff-55b6b1e2235a","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.609017Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:7d862728af01a7e5b8fe7661a49b9f6f7202fbbc708dc3378001e2e50f7a1de7","observation_id":"e9612554-9565-471e-920a-d940a518b9df","resolution":{"observed_at":"2026-08-12T16:38:11.001220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.975387Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":"ab1ada4b-6ebc-4ee8-8f38-e876a482254b","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.615828Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:f4b79514ca714800ac66da06b223d0f3293c9c423d888012e9eb7413e616883b","observation_id":"a852fa36-f5f0-458f-bc78-b053c27ab8f5","resolution":{"observed_at":"2026-08-12T16:38:10.981335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.954755Z","title":null,"venue":null,"work_id":"a89f1aa2-f978-41a9-b0be-8819ad5deeb0","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.622145Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:6b158ad6f042724d5ccf15fd921433d8cb6ad02bb0686bbcdbd9ce712be2f2ed","observation_id":"25b26d8c-8dc3-44cb-bad3-b381833ec000","resolution":{"observed_at":"2026-08-12T16:38:10.960743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.934688Z","title":"Prune spatio-temporal tokens by semantic-aware temporal accumulation","venue":null,"work_id":"332740f2-c106-475c-8fb2-2b601fa421f2","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.629775Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1fcb7eda0d5fcf8b0782866757b2cebb2d07567050696ecdf60426a5e9a93bb0","observation_id":"47cf182b-374d-48fe-93a6-9457ea518760","resolution":{"observed_at":"2026-08-12T16:38:10.941052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.635930Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.635930Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8d6056a2c048afba6c746657ac13db8b095d815b82266f6416f6ca1a4607a710","observation_id":"ff94fd5d-3e5c-40e1-83de-4cce007a8738","resolution":{"observed_at":"2026-08-12T16:38:09.635930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.903998Z","title":"Multiscale vision transformers","venue":null,"work_id":"5671e000-705c-42e5-bba6-4f6193cb8de3","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.643481Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:4f95a69a305991d0aac705d1b8b9b702229411b2388f5c2891450b7149e4e18b","observation_id":"5b345fdf-3da9-4331-a4cc-dd588465739c","resolution":{"observed_at":"2026-08-12T16:38:10.910305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.884315Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":"89d8c59b-73e6-4db9-8cbc-ff0e9dc7be67","year":2020},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.649118Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:4b02b2a34361bc6bd3a3c6767513abfe48482909725873adeb4d2209977b64dd","observation_id":"48f3a647-1921-41d7-8c5e-859bf389090c","resolution":{"observed_at":"2026-08-12T16:38:10.890972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.658326Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.658326Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:68408462b2605e6a4a2d921c24087373c26858ca0f4eb0f29241990ab7e9e42b","observation_id":"0bd73605-a781-43b2-ac83-0abdbf5e436a","resolution":{"observed_at":"2026-08-12T16:38:09.658326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.845417Z","title":"Efficient video transformers via spatial-temporal token merging for action recognition","venue":null,"work_id":"5863aa88-0abf-4522-a8b7-67ae4f941689","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.664529Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:4463c52b633d928d3dc139d6636189f931d17715a9749291cff003fc2a174f11","observation_id":"a7ea3224-d89b-494d-a436-a9a769696a5a","resolution":{"observed_at":"2026-08-12T16:38:10.851935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.670309Z","title":"Smart frame selection for action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.670309Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:f4f85344a0e1450bd9535f86d6da3f05924dbdbbf416b116cc2eb1e8e2502149","observation_id":"ec917cda-c365-402b-a165-4e86a39f60ab","resolution":{"observed_at":"2026-08-12T16:38:09.670309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06522","last_updated":"2024-09-17T14:30:04Z","snapshot_observed_at":"2026-08-13T05:53:07.215849Z","submitted_at":"2023-10-10T11:08:31Z","title":"Watt For What: Rethinking Deep Learning's Energy-Performance Relationship","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06522","snapshot_observed_at":"2026-08-12T16:38:09.676924Z","title":"Watt for what: Rethinking deep learn- ing’s energy-performance relationship","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.676924Z"},"links":{"cited_paper":"/paper/2310.06522","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:7f518bdca64c5a1db28add33ec5aec37598434ae6a8b91a26e4fbe315a307a11","observation_id":"a3eeda23-3d4a-4dea-9fd3-c64001b2df71","resolution":{"observed_at":"2026-08-12T16:38:09.676924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.805896Z","title":"Optimizing factorized encoder models: Time and memory reduction for scalable and efficient action recognition","venue":null,"work_id":"5f050c28-2cba-46d7-86f1-b603898a73d9","year":2025},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.684927Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:17eed643f16a1ac50443eae9b64f8b7fb3c3c3e632e39426dec2ed2c45032fde","observation_id":"bb986a7b-b58f-402c-a25d-1fc5628338a2","resolution":{"observed_at":"2026-08-12T16:38:10.812740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.781316Z","title":"something something","venue":null,"work_id":"74de16ca-d4f8-4aef-847d-60799d2b9e07","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.691332Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:687d5eb97265078b222492365b144eff08a4e3b76d75765619dfe9a71e062427","observation_id":"2edfc8e9-b2ce-4bce-a2eb-53498af96b52","resolution":{"observed_at":"2026-08-12T16:38:10.787929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.697107Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.697107Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:81dc9f59afea2d63ec83447e8e6f7ad55cb3c4fc38d386bb2679e73cb5566d0e","observation_id":"c0a9017a-ad20-4001-8630-4e55eef1602e","resolution":{"observed_at":"2026-08-12T16:38:09.697107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.746563Z","title":null,"venue":null,"work_id":"c1f0c5b8-0cdf-4774-8902-a7812e3bb807","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.702748Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:71c6ac4a604dbb3875eed8d3b792212aac4e3a0c0e8c9a9d5a7d97034df2a8df","observation_id":"adfa02c1-ed9d-4c8d-90f7-a8970e545584","resolution":{"observed_at":"2026-08-12T16:38:10.753008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12753","last_updated":"2024-07-17T17:22:43Z","snapshot_observed_at":"2026-08-12T23:20:10.521449Z","submitted_at":"2024-07-17T17:22:43Z","title":"LookupViT: Compressing visual information to a limited number of tokens","version":1},"cited_work":{"arxiv_id":"2407.12753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12753","snapshot_observed_at":"2026-08-12T16:38:10.112527Z","title":"LookupViT: Compressing visual information to a limited number of tokens","venue":"cs.CV","work_id":"ce2d81eb-6b3d-431c-8cf0-a8674a993a6a","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.707821Z"},"links":{"cited_paper":"/paper/2407.12753","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:0aedb848f20713350f06c0a9a257858b745e1d814cac892a931b221c4691d59b","observation_id":"cfa34fc8-2a72-4cc2-8ae8-ac1bf3f41028","resolution":{"observed_at":"2026-08-12T16:38:10.119977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.714750Z","title":"Revisiting token pruning for object detection and instance segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.714750Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8a1041d74e502b67936e837d4f030ee8ba4d90ae310076e6f308d2d7e8dd943f","observation_id":"ecbcfb01-bc9f-473c-92a5-b1b7cdfe0ec4","resolution":{"observed_at":"2026-08-12T16:38:09.714750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.711184Z","title":"Swin transformer: 9 Hierarchical vision transformer using shifted windows","venue":null,"work_id":"861f948b-3305-442b-86ad-28eab87cc366","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.720206Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e9fda917afb931a83b82bae0a1d7cab47b36313ca196b948dc1bbedbb6aaac0f","observation_id":"602013d9-90ab-49bc-873f-38010dd65c0a","resolution":{"observed_at":"2026-08-12T16:38:10.718586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.686397Z","title":"Video swin transformer","venue":null,"work_id":"598a283d-81a7-4a32-b7b6-eb2b2963cccc","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.725399Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:55f39fd796791e50449d1fdf9c85a9da1884b04991a17d8031dd5cf172c48ad1","observation_id":"1340edae-8416-4d56-8865-ae5b6f5ede89","resolution":{"observed_at":"2026-08-12T16:38:10.695342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.662915Z","title":"Video transformer network","venue":null,"work_id":"abc79da2-ef2c-44de-99ab-24099b6e0f28","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.732078Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:14254797366934fb354d91bed0ae83c8abe52d3c23b9879be1fc2fe3b2fe1881","observation_id":"59cbb268-d70c-42cd-975b-dc68b59c9c99","resolution":{"observed_at":"2026-08-12T16:38:10.671573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.737194Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.737194Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:5379abd1a65e43c57e10ac4a372fb1cf63e8183a3dcca258f8cc342597d9d888","observation_id":"6bb2d98a-286b-487b-8c46-1544f41c56a2","resolution":{"observed_at":"2026-08-12T16:38:09.737194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.744700Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.744700Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:ad8dcd579308ab5eabc668c954dd51b5a0379cff14361090260cf4b55ea75a26","observation_id":"d0797f54-8feb-45a7-8fdf-0511431ca87b","resolution":{"observed_at":"2026-08-12T16:38:09.744700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.619343Z","title":"K-centered patch sampling for efficient video recognition","venue":null,"work_id":"5f776812-331e-4fa5-897c-bb2d1e73ccdb","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.750699Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:26250006970223133f693ae500cc54b908bc320dc9a7a03b79e2a26bbc8578ff","observation_id":"a513123d-c351-407e-95d4-8c80f29e1fa2","resolution":{"observed_at":"2026-08-12T16:38:10.624875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.595432Z","title":"Asano, Is- han Misra Florian Metze, Christoph Feichtenhofer, Andrea Vedaldi, and Jo ˜ao F","venue":null,"work_id":"878fe0a0-8c97-4a04-8cd2-302a7927d71b","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.756350Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:a72d7547668af932db009e4498e6d42116bc8e7b1266697d138f2464791784c0","observation_id":"34fbc06d-8cd9-44a6-8a19-3d578edff604","resolution":{"observed_at":"2026-08-12T16:38:10.602725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.570660Z","title":"So, Maud Texier, and Jeff Dean","venue":null,"work_id":"311cbd1f-5e83-4ad8-bb60-8986a0ceea63","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.761549Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:f669986925bfa0a0b1f87614d365e9067c25b3647e28d82aa42ec509daa5fb9c","observation_id":"d5be688a-fbbc-48ed-862b-48795aed311f","resolution":{"observed_at":"2026-08-12T16:38:10.578776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06005","last_updated":"2024-01-11T16:07:58Z","snapshot_observed_at":"2026-08-14T11:17:41.128996Z","submitted_at":"2024-01-11T16:07:58Z","title":"How does the primate brain combine generative and discriminative computations in vision?","version":1},"cited_work":{"arxiv_id":"2401.06005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06005","snapshot_observed_at":"2026-08-12T16:38:10.077806Z","title":"How does the primate brain combine generative and discriminative computations in vision?","venue":"q-bio.NC","work_id":"3e12601a-e677-42a4-87e1-4b808e2e7da9","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.767230Z"},"links":{"cited_paper":"/paper/2401.06005","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:2905434eb34b5d5161b4d3d1897fa1f225df8e50439beffceabadcbd70e1b08a","observation_id":"89f85019-3d55-4d11-a005-a117a8eef86b","resolution":{"observed_at":"2026-08-12T16:38:10.086545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.773955Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.773955Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b7eddbb1bcef300039bdbc0f2effa5a71279958702d06db85ea4d785776efa4e","observation_id":"afecf784-5a76-4a59-b954-f984930b3757","resolution":{"observed_at":"2026-08-12T16:38:09.773955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-08-13T18:59:40.015343Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-12T16:38:09.781891Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? arXiv preprint arXiv:2106.11297, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.781891Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:b815bc4cd4c3da34acb8b723857ec2951685de789dc7a1f7450049fdb6c8c95f","observation_id":"c6e191aa-4563-456b-9d38-200a2507f493","resolution":{"observed_at":"2026-08-12T16:38:09.781891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.524383Z","title":"Selvaraju, Abhishek Das, Ramakrishna Vedantam, Michael Cogswell, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":"9b80409d-946f-4bfe-9e7d-6f7f448beffb","year":2016},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.788899Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:42420a18a337ac40c26010595e05d5a8b57eee0fb65ce568f1ea17d51fb1dfda","observation_id":"c64056be-71b2-4f73-a879-28f300e8441f","resolution":{"observed_at":"2026-08-12T16:38:10.531612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.497616Z","title":"Only time can tell: Discovering temporal data for temporal modeling","venue":null,"work_id":"88423a01-7449-48c6-85a4-4213941cd4dd","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.795722Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1e5ecebd6795ddaa648a62ff9aca82f018c6f0654f11d62671734303cdfafa0f","observation_id":"253eb58c-3783-48b2-8a40-03be771481f6","resolution":{"observed_at":"2026-08-12T16:38:10.507034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T16:38:09.801167Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.801167Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:ab27c98a1dabda19978620fb64f1456ac08db13cf75158a5aa00fefa4cfcd471","observation_id":"d826674c-9cc0-4f29-8b22-2b105315db20","resolution":{"observed_at":"2026-08-12T16:38:09.801167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-12T16:38:09.806583Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.806583Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:59f4525d060eb858fd58392681c4bfd51cf62a67eb27e6392cd9482bda4956c0","observation_id":"74e6b19c-f94e-4ecb-9e89-7e5ed0031801","resolution":{"observed_at":"2026-08-12T16:38:09.806583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.812884Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.812884Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:acbd693729e00efa419cbf23d4c058e9dd6a8f7df3d132211eeca10437fed91c","observation_id":"db30876b-61c8-4e75-900b-c2afe0611f5f","resolution":{"observed_at":"2026-08-12T16:38:09.812884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.453486Z","title":"Attention is all you need","venue":null,"work_id":"62c363e8-de31-486e-95ae-89a90875492c","year":2017},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.818358Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:3b19f55c35ee008a5455e98e3af54aa56ac2b5a97854ac3e37bab30fc5346461","observation_id":"42879cc2-add6-46c6-ae1a-77b6447084ba","resolution":{"observed_at":"2026-08-12T16:38:10.463112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.419637Z","title":"Efficient video transformers with spatial- temporal token selection","venue":null,"work_id":"55d4fcac-d346-4582-9350-1d80335f3886","year":2021},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.823324Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:0fc29c287c77a21c5cccef0f281d83d1dc1ec7e51ffcc9c4cd0bf1dd8bd07277","observation_id":"723c88fb-5569-4fa7-b021-9037e90ce588","resolution":{"observed_at":"2026-08-12T16:38:10.430041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.392193Z","title":"Actionclip: Adapting language-image pretrained models for video action recognition","venue":null,"work_id":"56848e29-494b-4809-a58a-b187880a30ba","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.829073Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:4d39e73a66d6dd0c5a3f20aa0a571420bc61d7d5987111482414744b35ae27a3","observation_id":"dffe762e-8325-4ff8-993b-c2834b93bc77","resolution":{"observed_at":"2026-08-12T16:38:10.405228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.368562Z","title":"Vila: Efficient video-language alignment for video question answering","venue":null,"work_id":"f3fbf7dd-bb40-417f-9ab0-843afbe6141c","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.833947Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:77e40370a15ba7a3f48628b9633d07deae4f3ec0f04b7cda6e9db6360179a569","observation_id":"17e7c3c5-5d9f-40c0-8763-a95ada95aafc","resolution":{"observed_at":"2026-08-12T16:38:10.378103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.338614Z","title":"Video-focalnets: Spatio-temporal focal modu- lation for video action recognition","venue":null,"work_id":"663d54a4-cf4e-4c2f-b7c1-d2db72c3dff2","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.841034Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:10ba2d527c164bc649d5540aa3e077eb268d7e7b106c692d1d9ff8da19fc720a","observation_id":"84b220ef-6547-4687-ac53-421d9391f825","resolution":{"observed_at":"2026-08-12T16:38:10.351817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.319486Z","title":"Manmatha, Alex Smola, and Philipp Kr¨ahenb¨uhl","venue":null,"work_id":"4af1193f-91f4-4e87-83c4-9e2f94c0dd63","year":2018},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.847893Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e2699bcd6f41a152a1c8f8b241064b830669560548054a1d91476640d55c94c2","observation_id":"665eb6e4-ab17-43a3-b74d-afbf74dd7766","resolution":{"observed_at":"2026-08-12T16:38:10.325086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.300244Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"e2d232a8-e4d1-499b-a592-842685698b80","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.853463Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:9161cae8b0806d4a2925b19cace04ac781102406357a3b99eda3e3df5dbb2ce5","observation_id":"7b6373a5-13ef-4083-b0ba-fab7f0b5b684","resolution":{"observed_at":"2026-08-12T16:38:10.306355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:09.859186Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.859186Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:1f3c8f74d99ad8fdab92e995b4fcaebb33f4464b8164d42b08afd43e5bae3e1b","observation_id":"79bb0272-bd07-4e33-93ce-2f1be485168c","resolution":{"observed_at":"2026-08-12T16:38:09.859186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.265098Z","title":"Aim: Adapting image models for effi- cient video action recognition","venue":null,"work_id":"f63b08a2-70ef-47e3-a00c-23ba49c356e0","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.865766Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:d530805f73b5d1b3571a80f2fe980aaf5dbb405bf37d4a2d68bdb1cd6c984090","observation_id":"d5201b10-1d8b-4aa0-a730-2072546fec75","resolution":{"observed_at":"2026-08-12T16:38:10.271496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.247590Z","title":"A-vit: Adap- tive tokens for efficient vision transformer","venue":null,"work_id":"a2211cbe-3eea-4a36-90b3-23584b8270ac","year":2022},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.872069Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:023366eb95e5b86ff0257f6b9fe213a0e5077b9828716c5b54a70a4792dffca6","observation_id":"7768a25e-84b1-41fe-a56b-15c65398e260","resolution":{"observed_at":"2026-08-12T16:38:10.253123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.229193Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"956bfc4a-694c-47f1-8ca5-9b153a197d23","year":2024},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.877725Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:e6675f5b9e352955454c3a293443847251432861c25de6ee29e8913f75e421c5","observation_id":"a7ba7476-5d2f-4e15-8c85-82037d865916","resolution":{"observed_at":"2026-08-12T16:38:10.235125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.211288Z","title":"Pyramid feature attention net- work for saliency detection","venue":null,"work_id":"4ffb5cea-152d-4d08-a847-63d82461613d","year":2019},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.883184Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:c641139c8fa077c67d3236e283f75d5ed9a8b6d4e7f742faaabceddb2aaa2f73","observation_id":"6f62fb58-6e13-44f0-b29d-15c2176a3f41","resolution":{"observed_at":"2026-08-12T16:38:10.217473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:38:10.187609Z","title":"How can objects help action recognition? 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2353–2362, 2023","venue":null,"work_id":"9aee6845-baf1-4995-b099-557500116c29","year":2023},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.889971Z"},"links":{"citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:ce2d525b9f078718f62d03e1a5323dac24563b0d87a67ba4f78a5072fa35b33f","observation_id":"c2c53224-c922-44fb-bbfc-34ab9845defc","resolution":{"observed_at":"2026-08-12T16:38:10.197334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09066","last_updated":"2018-05-07T09:46:08Z","snapshot_observed_at":"2026-08-14T19:22:32.330936Z","submitted_at":"2018-04-24T14:30:56Z","title":"ECO: Efficient Convolutional Network for Online Video Understanding","version":2},"cited_work":{"arxiv_id":"1804.09066","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.09066","snapshot_observed_at":"2026-08-12T16:38:09.946149Z","title":"ECO: Efficient Convolutional Network for Online Video Understanding","venue":"cs.CV","work_id":"2c925ec6-c79a-46c9-8d5a-4caccfeba473","year":2018},"citing_paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:09.895402Z"},"links":{"cited_paper":"/paper/1804.09066","citing_paper":"/paper/2411.13626"},"observation_digest":"sha256:8e0c28a0838a7ee6a7fb141b5c27da0a10b3f3ed16e105979611356ce845ec15","observation_id":"95ba41bf-3a83-443d-8bac-6c62795b021e","resolution":{"observed_at":"2026-08-12T16:38:09.954883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13626","last_updated":"2025-03-23T19:09:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:06:59.882009Z","submitted_at":"2024-11-20T14:09:47Z","title":"Principles of Visual Tokens for Efficient Video Understanding"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":32},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2411.13626."}