{"as_of":"2026-08-13T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b0147da57b3c1fa881fb863093188a8fd4312cd900b32f5ff869668d98a5db7","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:22:25.355326Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13683/citation-record","integrity":"/paper/2411.13683/integrity","json":"/paper/2411.13683/citation-record.json","paper":"/paper/2411.13683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.014117Z","title":"Towards long-form video understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.014117Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7dbc108c4f2fa632e4153b8f5d3de178008188fa215343bbaa84a21c34846761","observation_id":"84cf1d58-7cf6-4e59-b24a-18365b0499be","resolution":{"observed_at":"2026-08-12T16:22:25.014117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.018939Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.018939Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0afc2750ba35ac3fb72463814509b74d6ec594c709a0e2eac1948b5f17ff580f","observation_id":"57d954e0-e57e-4b91-834e-9520d8a00794","resolution":{"observed_at":"2026-08-12T16:22:25.018939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.438053Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":"06f41883-59c8-4f6d-9277-13d9a566cc33","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.023182Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e7ef605b333e30d8ab1f09de7544664192eaa3bbe84eb2a0c3c44e27db3b839a","observation_id":"1e2090b2-dcc2-4824-91ac-5108d39886e7","resolution":{"observed_at":"2026-08-12T16:22:26.442059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.424221Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":"99fbf379-b343-4ac6-b6ec-b3c68df237ce","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.027369Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:4eed3de9aefb3d9dae76797f28c84ea6aaef4267da9870c11f920779419c126f","observation_id":"3abf5ab4-b5ec-4dfe-a7e7-e0e7e9f6434f","resolution":{"observed_at":"2026-08-12T16:22:26.428871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.410764Z","title":"Memory consolidation enables long-context video understanding","venue":null,"work_id":"62b4a85f-21e5-4ceb-9684-93e058ec2371","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.031425Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e13fb15c0237816c0589b3bbd0ab832d32cf2a0ae656e0f666e0c0d8de16bf77","observation_id":"e1d2eb4b-a9ef-4679-8eb6-ccfb70df90db","resolution":{"observed_at":"2026-08-12T16:22:26.415408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.395583Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"9c51d095-c2d3-4c1d-bfd6-c57ac2590c0e","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.036030Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:743ba8aeca013c59eb5b279d03513f771737c143c1a3a7ca74c1d42119420125","observation_id":"fad0160e-a622-46f0-8cbe-1ba5c085f687","resolution":{"observed_at":"2026-08-12T16:22:26.401384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.382425Z","title":"Token turing machines","venue":null,"work_id":"43a29f53-80ed-43d0-9406-9e4aabc20bb0","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.040506Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:739d79118ca124e66725d114fc1d384840a3bb8ee716f213cd944ca5a9f90382","observation_id":"9136e534-9098-4a59-9d9b-2b43c8578db5","resolution":{"observed_at":"2026-08-12T16:22:26.386697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.369949Z","title":"Video recap: Recursive captioning of hour-long videos","venue":null,"work_id":"16e4ab91-eb5f-4ebb-93c2-d1234192645b","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.045808Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:5bbe8a0ed994c25ba092bd4a9c1f166567a220437884008311c35e45407f609d","observation_id":"1ee8d817-2f90-4da5-b5ff-b16c8255302b","resolution":{"observed_at":"2026-08-12T16:22:26.374304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.356276Z","title":"A simple recipe for contrastively pre-training video-first encoders beyond 16 frames","venue":null,"work_id":"a0ec4339-eb7b-4c90-9822-210f917cf180","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.050401Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9586c74f8297c89ef053fca26d08a9d069f7f223de62c53925331a8ae9c35d94","observation_id":"15282ec6-ac03-48a8-bb04-1f898e7a3bc4","resolution":{"observed_at":"2026-08-12T16:22:26.360794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.054724Z","title":"A simple llm framework for long-range video question-answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.054724Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:d3ba65a5ae1c32acb450be406a54dbf83d21cc78d0a11e2d9da3dc42740c4dbf","observation_id":"96c04c42-cb02-4ce3-a8e5-aba75807fbeb","resolution":{"observed_at":"2026-08-12T16:22:25.054724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.336598Z","title":"Long-form video- language pre-training with multimodal temporal contrastive learning","venue":null,"work_id":"4cf67bcb-1652-42d5-a008-9cb6ffbb85a8","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.058702Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:ebb75945d8be89c70b0d4eb103d953716fd6f31bc8dcda9e268eeb3999b5b48c","observation_id":"b28fee82-238e-451f-a888-05e92652f15a","resolution":{"observed_at":"2026-08-12T16:22:26.341094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.324285Z","title":"Koala: Key frame-conditioned long video-llm","venue":null,"work_id":"7e05e91a-bdc9-498e-8d5f-d0ce650c1a74","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.062400Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:92078be20c6b997061ea81197560a7eab3fe34e264ce702483ecc491e144cb51","observation_id":"4dc4e05a-4e81-45f9-ba36-ef5bdde63ccb","resolution":{"observed_at":"2026-08-12T16:22:26.328284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.313084Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"b574607f-9917-4551-a9c0-88200c1dd6b3","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.066391Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:08a7ea179dcbe82673b07a645f0cdb14164ecf5b3c0ebc5a052317c5e0f077b4","observation_id":"9104b8a1-ea81-4e5d-b003-51f7c116eb30","resolution":{"observed_at":"2026-08-12T16:22:26.316949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.299112Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"091e5dc1-f98d-4fb0-9390-0f0c18bf1e5a","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.071077Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0eb922f607073d970b1dc15b6e0be11d2351d1b4f084bc8559ffb4165a918c20","observation_id":"30a10d9c-6a53-456b-9d89-fc6543a31d37","resolution":{"observed_at":"2026-08-12T16:22:26.304662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.286236Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"60e7c414-f426-4804-94d9-2b027547ed8d","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.074927Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:29a2284a7be74ae226695b5ff6462ec35b88457dd5564ccd4cd31faea0918213","observation_id":"61aa62bd-3850-4120-ade0-88283e9a3003","resolution":{"observed_at":"2026-08-12T16:22:26.290950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.274400Z","title":"How can objects help action recognition? In CVPR, 2023","venue":null,"work_id":"40416d0d-d462-4f27-a014-49ab5b761dea","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.078492Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9d914b0cd039500763f0db44fce857ce99b437af89c5daa40747de8684f65541","observation_id":"cdd82006-37e8-4192-a1fe-5725f23d39cc","resolution":{"observed_at":"2026-08-12T16:22:26.278784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.262085Z","title":"Everest: Efficient masked video autoencoder by removing redundant spatiotemporal tokens","venue":null,"work_id":"c79821ff-d82a-4610-a73e-97648ab5176e","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.082930Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:19d3ebc58c97360c34e65e7d8682c1a7e9db72429c77e65ce23fc5a791d15cc5","observation_id":"2d832d9b-485e-4aca-8091-c506b8885877","resolution":{"observed_at":"2026-08-12T16:22:26.266111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.249264Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"538627ea-3ea7-4269-9adf-6145ea3ee2e5","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.086594Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:dc89e4fe32e172aab2160ff81b5a03218fde9d0a7002c3f62f0a5da22052ad03","observation_id":"9d1350a1-3813-4f80-bbf4-6a55f4baba20","resolution":{"observed_at":"2026-08-12T16:22:26.253869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.237136Z","title":"Resound: Towards action recognition without representation bias","venue":null,"work_id":"07d4ee45-463c-48d9-9068-3bfa44d29577","year":2018},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.090422Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:878ea058858635548cad6d314019754f495efd949ea1e8cdacc2ce16a878915d","observation_id":"6c0d1bea-e94f-46af-ab04-b4c051bd18c1","resolution":{"observed_at":"2026-08-12T16:22:26.241287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.225327Z","title":null,"venue":null,"work_id":"44afc774-39a7-42cc-8ee5-14e87ea0204d","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.094637Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:91250449a63e0b6479b1807c9e5618f0cabc5405facb2e2a89b8da58578ed9e6","observation_id":"21f1223f-011f-4832-ade6-2ee718f0afb4","resolution":{"observed_at":"2026-08-12T16:22:26.229238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.213786Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"f1b7d7db-bf6d-497c-831e-fab2094aabb3","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.098703Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a5b098710ab0bac235ab670b4252f82d65c6c7c058afadc614d63cf9f1e1ba7a","observation_id":"05497a92-60ff-443e-9f04-71f253a54044","resolution":{"observed_at":"2026-08-12T16:22:26.218024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.201328Z","title":"Girdhar, A","venue":null,"work_id":"ba6abf80-a880-41a9-91a0-0a4aed769e0c","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.103922Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:093dac02808b34c0685650fc66dbdf5aa568445a16b8b8ed61fdca27830e9f98","observation_id":"e5e7babb-2187-497a-af9d-76469a1373b0","resolution":{"observed_at":"2026-08-12T16:22:26.205639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.189624Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"dd5537cf-25ac-43e0-bd19-b9442463519a","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.107960Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:19f1d413ccc1f29f024ddbe7e797ed8e09729bc2087521d5e47f02570143ffdf","observation_id":"713e89ef-4263-417a-b095-74a19c92e633","resolution":{"observed_at":"2026-08-12T16:22:26.193574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.178159Z","title":"Masked video distillation: Rethinking masked feature modeling for self-supervised video representation learning","venue":null,"work_id":"1f3313f3-1544-4ea5-86fd-f74f048230e0","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.111942Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:fcfa7b874fd47bc5cd2b79482a6501c258a64511ad81a46159a457426534b1ac","observation_id":"bc7e4fd2-2979-4311-a58b-b08529e687ad","resolution":{"observed_at":"2026-08-12T16:22:26.182211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.165040Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"611dccc6-acc9-494c-b2ce-117168e8f5cd","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.115504Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:46867cc501de3b3665ddf61b1737a26d85b61181c3869084d39b5057b0d34b85","observation_id":"e5511110-75f1-465e-bd26-2f2d846c7286","resolution":{"observed_at":"2026-08-12T16:22:26.170158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.139237Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? In NeurIPS, 2021","venue":null,"work_id":"299243d5-c0ba-4854-a8f7-0ee3407816b1","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.123089Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:53cb1356e8996a702e3259a1f39e9d76f95ee73d99e5f5e6faaefa0a323ad174","observation_id":"929db5b8-04b5-4e3d-a6cc-91d48a12431c","resolution":{"observed_at":"2026-08-12T16:22:26.143450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.126398Z","title":"something something","venue":null,"work_id":"cb44bb7f-94a2-4c53-b6d6-65c222c98028","year":2017},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.126787Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6b05e2d53fb23c533e180ee19f930577c099bbd28dfda20ec14dcad1831d9950","observation_id":"9cd15a53-f043-4a68-9079-f5e6871c87d9","resolution":{"observed_at":"2026-08-12T16:22:26.130927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.114759Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a925782b-f3cf-43b9-86db-a5ae1df40c89","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.130449Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:3015f2709120661b12e4b293d955f6e9197023ea421eea2e6ac27ebda94c94ab","observation_id":"319a40db-cab6-42ab-86cd-b86c83095958","resolution":{"observed_at":"2026-08-12T16:22:26.118986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.098921Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"994fdae3-48ec-4d9e-a577-1e353dc8ed07","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.134329Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:acaa91438654b1ae448fabb7d91703160db87425167a92360b0e07489f225f43","observation_id":"d87ef826-a40a-4764-958d-63623af7b0cc","resolution":{"observed_at":"2026-08-12T16:22:26.105953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.086801Z","title":"Motion-guided masking for spatiotemporal representation learning","venue":null,"work_id":"ae8aa3fa-edbb-4e1e-b78e-2f9c3dca0a02","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.138258Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f07b3e9eb367c4b70f09cbfe54accb8a6b74429f7572de92b065e042f8d20c19","observation_id":"b5b0e6f3-fc2d-408f-a232-3ca3c19afbf2","resolution":{"observed_at":"2026-08-12T16:22:26.091040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.072093Z","title":"Video codec design: developing image and video compression systems","venue":null,"work_id":"7639878d-9141-4705-b0e0-b6fb2aab76f2","year":2002},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.142170Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9b3c4078cb4c3218f185d7f44bd0f365a76b2a420e00d62d67072bcb50076bb8","observation_id":"e32096bb-4f64-4512-ac99-52032f45532d","resolution":{"observed_at":"2026-08-12T16:22:26.077412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.058289Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"de5adbaa-825c-4501-9126-c3b2b79de5a8","year":2020},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.146065Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:40434ed50936b3a07d8a3728b3d5d9994b247c4f4cc0868b0f4b562e373f1b6c","observation_id":"9a8ae6a4-ee82-4266-bced-f94d9ea68a02","resolution":{"observed_at":"2026-08-12T16:22:26.062271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.046571Z","title":"Videoprism: A foundational visual encoder for video understanding","venue":null,"work_id":"72932077-4725-48d7-9ba2-54951157cc0a","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.149577Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:ad77ab146d9738bb419b922dc499cbb3aca04aa2d0f25f1feaae3be5811bb987","observation_id":"d71d0fc2-7964-48d3-9875-5cb23baf2090","resolution":{"observed_at":"2026-08-12T16:22:26.050812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.033548Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":"98e0e9f6-308c-4982-a6c2-330477e0aa0b","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.153989Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e7376d812c9c5ba38c084946c625837e43a0342c9d1389100f0e80793ab581cf","observation_id":"0c81c503-ca16-426b-8f61-e24d49b7afd8","resolution":{"observed_at":"2026-08-12T16:22:26.037738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.019914Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"a336dc12-89d0-4c8b-8eff-83a92a86d028","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.157567Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f7d15aff8c81445f03173352ac305e4be2d86a8203fd4c0b2bf589cd4b5268bc","observation_id":"55a81fcf-1c28-4640-b3d8-ce4c2b551f17","resolution":{"observed_at":"2026-08-12T16:22:26.024691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.007088Z","title":"Finite scalar quantization: VQ-V AE made simple","venue":null,"work_id":"f9432013-3858-44a3-99b8-32a9e0384053","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.161177Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:2da3759e73c952cec2ec10cdbc80c52e1b5f32239793942f2ac1f522ac05ccd4","observation_id":"07e3e8ce-9ff2-4a61-9d79-e761d97b7bfb","resolution":{"observed_at":"2026-08-12T16:22:26.011181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-12T17:41:53.544669Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-12T16:22:25.164843Z","title":"A short note about kinetics-600","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.164843Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:41a5db2096c533b15a68fcdf8462d07fa0a66eb53863eb77d47fe5488f02bfda","observation_id":"02398460-7a6d-40c7-bf63-b314a15cce3f","resolution":{"observed_at":"2026-08-12T16:22:25.164843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-12T16:22:25.168857Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.168857Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f305272be26837037e72fab8f7800f5ffaedd2a8185a5f591409b042fce57207","observation_id":"95ecca2f-f416-4873-9e90-80143ff10102","resolution":{"observed_at":"2026-08-12T16:22:25.168857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.991929Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"8784c769-46f7-41fc-8621-35e9c6d35323","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.172795Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:cd3090229baf306a0d12976459ca39cd82441e5d6c3139ae58133efa2a15dcb1","observation_id":"a196cfee-b1a4-49b0-b4a2-0d09a82b791d","resolution":{"observed_at":"2026-08-12T16:22:25.997209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05787","last_updated":"2023-08-10T17:35:47Z","snapshot_observed_at":"2026-07-06T16:05:02.242338Z","submitted_at":"2023-08-10T17:35:47Z","title":"Temporally-Adaptive Models for Efficient Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05787","snapshot_observed_at":"2026-08-12T16:22:25.176362Z","title":"Temporally-adaptive models for efficient video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.176362Z"},"links":{"cited_paper":"/paper/2308.05787","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:45c4524b4727bee59bc3a00714ff4d0edb71f4025b7ce83f774d3df5df009805","observation_id":"33cfc5de-95ae-40d3-8b38-2227648e89d7","resolution":{"observed_at":"2026-08-12T16:22:25.176362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16669","last_updated":"2023-09-28T17:59:50Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:59:50Z","title":"Training a Large Video Model on a Single Machine in a Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16669","snapshot_observed_at":"2026-08-12T16:22:25.180917Z","title":"Training a large video model on a single machine in a day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.180917Z"},"links":{"cited_paper":"/paper/2309.16669","citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c241c59a8adfd7ba5cd07790f5a94a212fe5d4012e90c14012da5b8d7e9b3bcf","observation_id":"2f028e33-ae02-4d0b-8d47-ea889ce8eda2","resolution":{"observed_at":"2026-08-12T16:22:25.180917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.979307Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":"c3028c64-f15c-405c-99d2-f8a725ea0326","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.185019Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9b2bfc6b48dde279d9eec1fcbeb20fcd6e6b43c4023303e2a894980febedbdfc","observation_id":"72d5d421-0073-40e7-8db3-f1349385d633","resolution":{"observed_at":"2026-08-12T16:22:25.983302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.968262Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"6d17a31c-56e8-4ecc-8b81-f052e82e3ab4","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.188571Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:be2e9792d04e3d518322234d9eb1b4b694eecb3dfcb118bb6a0efc54e2269430","observation_id":"45a79a2a-274c-496e-b7cf-87f33caffe1d","resolution":{"observed_at":"2026-08-12T16:22:25.972248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.957276Z","title":"Verbs in action: Improving verb understanding in video-language models","venue":null,"work_id":"710e7f3c-bc9f-4883-b072-d91b162010d6","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.192158Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6aaaaebc7e09288d53361766ef0836b99656c684f81784e86cf85c3293f91e39","observation_id":"bdb7e0cb-169d-4786-bfcf-e6475c709066","resolution":{"observed_at":"2026-08-12T16:22:25.961247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.945910Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"03d75a74-b263-40e3-afd4-67233e30b2d6","year":2019},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.196373Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:1b788ba275d156553eaf57a89eedfa9a993d0152466266f8d0880e2d6e7a00d2","observation_id":"ec83fec6-7af5-4875-aefd-eb8f725487be","resolution":{"observed_at":"2026-08-12T16:22:25.949510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.935400Z","title":"Interactive prototype learning for egocentric action recognition","venue":null,"work_id":"c2f0f094-3af2-49c1-aa0a-af36201120f6","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.200298Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:107983446bd1bc1bb1a759b8e66db48dc2a11f5337c9025dd6d1b17d335b3a31","observation_id":"24b0f31e-184e-43ca-9067-4636c6be323f","resolution":{"observed_at":"2026-08-12T16:22:25.939197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.923874Z","title":"Movinets: Mobile video networks for efficient video recognition","venue":null,"work_id":"fed16499-3641-4a91-932d-c967dced75dd","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.203795Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:414a310e2f9418d116da3cc260b3f8d29ec97d1072eefd07852f77094568516f","observation_id":"0be7e6c2-5f50-4e9f-aa24-cd85927732bb","resolution":{"observed_at":"2026-08-12T16:22:25.928022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.911559Z","title":"Omnivore: A single model for many visual modalities","venue":null,"work_id":"75f83060-71b0-4923-96a7-e27c6846405c","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.207333Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:44d95dbd4ce31000e3e4a0ceda15464c59e47dbaec81fa5a7d9fcb01e2e0526b","observation_id":"a08bd723-c388-4787-9478-9e4cdde59e2d","resolution":{"observed_at":"2026-08-12T16:22:25.916079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.899351Z","title":"Learning video representations from large language models","venue":null,"work_id":"da3032df-9a75-4e57-8fe8-8df8828ae8e7","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.211110Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b045b4c2b057fa664023e1262b09ee3d29ded27164775a56eb3a4fb31b05646c","observation_id":"08528d82-d877-41a5-ba58-e4c47280dda9","resolution":{"observed_at":"2026-08-12T16:22:25.903493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.887869Z","title":"Is space-time attention all you need for video understanding? In ICML, 2021","venue":null,"work_id":"0243811e-89f6-4d4a-91d3-ea22b4a0a6b1","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.214507Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:74e525c94469eeac78bf792e0a2c9c598899283cbd1c954bf003518ad2a6654a","observation_id":"994e1ecd-afde-4267-9eff-b2a21a9e9a74","resolution":{"observed_at":"2026-08-12T16:22:25.891843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.875903Z","title":"Video swin transformer","venue":null,"work_id":"d3357dbb-2756-457c-9eaf-8f74d469d69b","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.218269Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:61904f585afb1019635a65bd11b2a8a83b9314e7d0f0b464370ff1bfea8dc153","observation_id":"62167356-5e55-4fb7-8620-e87d6e8f161f","resolution":{"observed_at":"2026-08-12T16:22:25.879718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.865156Z","title":"Can an image classifier suffice for action recognition? In ICLR, 2022","venue":null,"work_id":"cb23232c-0b15-4d30-b27e-c2296b201d09","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.221993Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a9f1d8e08573fb09e62c2d30300a747b7fe3c0bcd4462e66c798be79be41e478","observation_id":"be25e975-2432-4536-8ce7-8d7427f0d842","resolution":{"observed_at":"2026-08-12T16:22:25.868902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.853321Z","title":"Object-region video transformers","venue":null,"work_id":"756092c4-4b53-4053-b29a-b8804a3f511f","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.225841Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:e5c62ebec7482459662639d5fd83cd15ddcadbcb3f6e90023a9a4914ca1a0687","observation_id":"5efa996f-7043-42bb-bb20-13945d3dc966","resolution":{"observed_at":"2026-08-12T16:22:25.857839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.841691Z","title":"Aim: Adapting image models for efficient video action recognition","venue":null,"work_id":"a14318e8-8fdd-42c9-ada9-54b3b1e17827","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.229883Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:5340a275f38f6fcf5cdf197bdf985c59d9edf4f6f11481f302710149bd18e0fc","observation_id":"738d1098-9f5d-4766-8627-53e4d24a5d64","resolution":{"observed_at":"2026-08-12T16:22:25.845804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.828382Z","title":"Video-focalnets: Spatio-temporal focal modulation for video action recognition","venue":null,"work_id":"b7dbd5f8-ea3b-461f-b2a1-9cdbd0c3714e","year":2023},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.233575Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:ba354ab71114825b43ca8a375e6acdb0176fb4ee12fae3ce657129df7054ccf1","observation_id":"26189b8b-33f3-4750-9990-c658006ca20a","resolution":{"observed_at":"2026-08-12T16:22:25.834222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.812457Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":"63c62585-f3d5-477d-9dda-b89162bd10e6","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.237643Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:94ab96816d6575df8ab3715d4edc980f8007dbed1429db00a29677bc0cc82615","observation_id":"6d0e83f9-ab6a-4b0e-910c-dc8b000828e3","resolution":{"observed_at":"2026-08-12T16:22:25.819649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.798508Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding","venue":null,"work_id":"6458fb17-1ff5-43b9-ad16-1e92043d0bbc","year":2020},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.241462Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:339560573c077abff5acbf0976df7caa7829c0d56423b4983c38640904cdcd67","observation_id":"35bf2940-3183-4085-8371-02c89b5ee713","resolution":{"observed_at":"2026-08-12T16:22:25.804450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.784872Z","title":"Learning temporal cues for fine-grained action recognition","venue":null,"work_id":"31928056-a81c-4c83-80bc-d9f0d21c63e5","year":2024},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.245443Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8c10355527655f5f0dd7d5edbbcea7bff4586de30faaee36627df34fa8a97a68","observation_id":"c0e06bc4-9991-4702-8521-b65e8aa77aa3","resolution":{"observed_at":"2026-08-12T16:22:25.790238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.771118Z","title":"Tsm: Temporal shift module for efficient video understanding","venue":null,"work_id":"02ed60af-4516-4ef4-9cd5-5bd884c9323d","year":2019},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.249266Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6c6f1dad622bd119d56c0d9efc45f02efab37e277e2e2fbba74f8c6ead6f102a","observation_id":"b2aa5f83-862d-4df6-b1f7-ebe7564d0c09","resolution":{"observed_at":"2026-08-12T16:22:25.775928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.758420Z","title":"Temporal query networks for fine-grained video understanding","venue":null,"work_id":"bb3a6994-675d-4701-83e6-50667e6fbbc3","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.253411Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:5542ced59933e6c887dc0947d44fee99e08c6e10196985c7f854b3ff4e2372d3","observation_id":"33ddac3d-e7d2-4c61-85b0-c7df2c2651a0","resolution":{"observed_at":"2026-08-12T16:22:25.762566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.746347Z","title":"Combined cnn transformer encoder for enhanced fine-grained human action recognition","venue":null,"work_id":"51347a14-1797-411d-b610-f676fd7885bf","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.257990Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6f9886d3689b59c67b76cf203da9f0f96af0ff6beeb2d1609f742441470c4868","observation_id":"d5c37d89-8b6f-4e04-b893-76292cb9fbaf","resolution":{"observed_at":"2026-08-12T16:22:25.751023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.732957Z","title":"Going deeper with image transformers","venue":null,"work_id":"a7f99ccb-6aab-4bec-bfa0-42bd75360d8f","year":2021},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.262106Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:c11cc97dc43c6f7409082ce72561b6221022654ac1f42ccb5889f6aece8b28fb","observation_id":"c1217cf0-e260-4354-a23a-649cf1548550","resolution":{"observed_at":"2026-08-12T16:22:25.738041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.713060Z","title":"Scenic: A jax library for computer vision research and beyond","venue":null,"work_id":"e92040b2-7f11-4968-9300-04de3c4a831b","year":2022},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.266075Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:f55ee67a83fa275d21789bc5d8e9ccb2bfd37b198d33247368c3d444b046cd5c","observation_id":"e4c247d4-831e-46c6-a25f-64cfd87e3220","resolution":{"observed_at":"2026-08-12T16:22:25.722729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.694335Z","title":"We found this slightly improved accuracy ( +0.5 points on EPIC-Kitchens-100 Verbs and +1.2 points on Diving48)","venue":null,"work_id":"ff1a4b03-0519-4e7d-8641-c7e3eacdf931","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.270584Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:15dfa97420f51d56d47558cadcf14833f9b603e9ec43a9b6552a0824d1a26a1b","observation_id":"0a74a736-5133-4c9c-a196-f891b24fb370","resolution":{"observed_at":"2026-08-12T16:22:25.700975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.676669Z","title":null,"venue":null,"work_id":"ca3309dd-05ec-47ff-ac7b-e3c166b5e5b7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.274933Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:08d05bf2f46aeab61ca6ab7652a8ca8a88a5fa860650f4499b0a75b1f4546f8c","observation_id":"e8883ef5-e7c8-4e61-a54c-8143413ce151","resolution":{"observed_at":"2026-08-12T16:22:25.681314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.662891Z","title":"17 Table 9: Model size vs frames","venue":null,"work_id":"a3f4fab8-69a6-4553-bc0e-1f9400598254","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.279010Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:cf990f5ea96ceac52d59dc7095356736d444b8bb8714c1121526f78fa3593c94","observation_id":"7121ac07-0f58-47f2-ad01-88e579276083","resolution":{"observed_at":"2026-08-12T16:22:25.667471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.648146Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"998fc9d0-015c-4f8a-871c-352ba5404734","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.283416Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:615f2fd09a6b20fabbe3057e6bf6d1b4d4a5d16c6c910c8ba884f28b517a0949","observation_id":"13270ed7-aa41-42bd-a1da-25f5ef192c76","resolution":{"observed_at":"2026-08-12T16:22:25.653781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.630877Z","title":"Limitations","venue":null,"work_id":"6975e314-d5b4-4248-81b1-329baa01399c","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.287958Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:8f5fd342397ed9b028dc2a360969742b2de409e560abf14fb06effacf7307649","observation_id":"fd7f5d79-0999-4578-ba91-897e965c755c","resolution":{"observed_at":"2026-08-12T16:22:25.636688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.614592Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"482b6821-78c3-484e-a2d8-2e35229444f7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.292611Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:4d11b8f06b3da3691433bacdf388ef66cada7efcc853a4f2be65eea024fc630c","observation_id":"10456fc6-93cc-44fe-982e-3888d20813f1","resolution":{"observed_at":"2026-08-12T16:22:25.619738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.598941Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"0eb07254-6d5c-4fc3-98ef-a4b7a1bb3d03","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.296935Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:2e51c80472837b3213743d8096a8bbb63faccb7f792684348b07aa97af5a295b","observation_id":"955057ce-da5a-4eab-b8a1-3bb1e743a1f6","resolution":{"observed_at":"2026-08-12T16:22:25.605281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.582561Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"809681bf-4f54-4d10-b69f-de86e9db72b5","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.302631Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:be7378687065e90e221826a7b1c2e8d37c83748dda5112aaceee3ada5815e161","observation_id":"05b446cf-6eb3-4330-affd-25d7dd01dfe0","resolution":{"observed_at":"2026-08-12T16:22:25.588626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.568064Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5abc5d00-6a06-4c52-99e5-90242ec31ce6","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.307592Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6a87ba86e11c4957bbe0693aeedebfd12bf0c44cddd87a0e7066ca0e910310bb","observation_id":"903717b9-95c5-4a0b-ab71-e54f72805d1b","resolution":{"observed_at":"2026-08-12T16:22:25.572605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.552983Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"13400cfe-4a80-4e7e-bfd7-76a597e1991b","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.312618Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:cf5704c6c944457b0449d14c650cab7a4986209c35b40f9cea4ce1b3ac6572b9","observation_id":"7504251a-762c-41d2-ad08-4e797b83ce0a","resolution":{"observed_at":"2026-08-12T16:22:25.559349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.539154Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"588189f8-4d47-4ec2-a300-0e5318d5e75c","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.318955Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:7f6c910f7e8f3c7fc085615643506c0f883e36b34cad37b3ab392068ccfd75cd","observation_id":"e409290e-ad8e-4ba9-95c5-8ff826b82976","resolution":{"observed_at":"2026-08-12T16:22:25.543694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.522501Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"75bf94bf-95c3-4a22-ad16-fe8a213c2bf7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.323122Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:13b97b5f88f0601899d86162e2a8b9da9f27b588e6e07e23e07d446369059d06","observation_id":"151092d4-fe23-4c42-8e99-94dce5af1702","resolution":{"observed_at":"2026-08-12T16:22:25.528011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.506402Z","title":"• If the authors answer NA or No, they should explain why their work has no societal impact or why the paper does not address societal impact","venue":null,"work_id":"d0fe0802-fef7-497f-acf2-676d8cc13fbd","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.327717Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:31f95add8e5cc4dcd786a57d53c7419f6707376a67729fd4d8e4f4b707852f43","observation_id":"27550e91-dc95-4ad8-834c-1d3ca347c615","resolution":{"observed_at":"2026-08-12T16:22:25.510829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.492409Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"1093d8fc-c7b6-4bbf-b537-c846f80ca035","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.332877Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:b924696458402f27c9fb403e47ea58f268ec3b3db33914ee04c91b2c8b19804e","observation_id":"1832e7fb-510a-4c78-80da-e7490525eabf","resolution":{"observed_at":"2026-08-12T16:22:25.497541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.479831Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"73a08f1e-e9ae-47eb-9e73-ba12d9629e86","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.343151Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:0f520d5abfbe93bef614baa5303002ae3688dc483bb3fd4bb259c40a94c9be31","observation_id":"e87e9080-6d21-4d13-8e92-c9dc39889c6e","resolution":{"observed_at":"2026-08-12T16:22:25.484090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.347041Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.347041Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:a3c4af871a2194a945c676718d76e85b12f4b07eb95654f81405cd4545a256c4","observation_id":"0f1ef82c-5084-4726-b5f5-3e7278d9683a","resolution":{"observed_at":"2026-08-12T16:22:25.347041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.459882Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"96e4c692-b098-4489-9b30-e842c5a0dd26","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.351339Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:9c49c13da05da5d18bbb218a40d8121d660ac39c5724bfa7add1fd8ed79d832a","observation_id":"32ea79b1-a7bb-4d37-9d42-eee4bc252c05","resolution":{"observed_at":"2026-08-12T16:22:25.464389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:25.442953Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"83291064-0128-4a9b-813e-d4db1e7ab645","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.355326Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:6fd079a6210125ba123166522c109396c5ce2a5f8842e01583569dd700973c02","observation_id":"1f04bade-1819-48ac-ab45-49e80ce8e8d8","resolution":{"observed_at":"2026-08-12T16:22:25.450458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:22:26.151170Z","title":null,"venue":null,"work_id":"c8f922e4-f4dc-4ba8-9450-248809b21aa7","year":null},"citing_paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T16:22:25.119455Z"},"links":{"citing_paper":"/paper/2411.13683"},"observation_digest":"sha256:24f141f431fb2e822aceb794f0a1b39e2a4d04537cad901b5a2d122c5f51f5b5","observation_id":"17e2c672-1e70-46a4-a07b-68f28e108efe","resolution":{"observed_at":"2026-08-12T16:22:26.154889Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13683","last_updated":"2024-11-20T20:00:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:44:21.794748Z","submitted_at":"2024-11-20T20:00:38Z","title":"Extending Video Masked Autoencoders to 128 frames"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":10,"verified_exact":0,"verified_fuzzy":71},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2411.13683."}