{"as_of":"2026-08-17T19:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acdc36aaae0ee1c0fc3794057ae0488f80cea90f7a8245958e121229a6b4c528","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:55:21.602712Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08561/citation-record","integrity":"/paper/2505.08561/integrity","json":"/paper/2505.08561/citation-record.json","paper":"/paper/2505.08561"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.948079Z","title":"Learning to see by moving","venue":null,"work_id":"06b09177-b7f1-4a1e-9943-17f8d1da4379","year":2015},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.232608Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:9f6778a5ddc041afdd2792786d1732292939ead12f45b022df217c27542e5ccd","observation_id":"456fc492-22d3-4e44-9a34-954739288557","resolution":{"observed_at":"2026-08-15T21:55:22.952347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.932339Z","title":"Self-supervised object detection from egocentric videos","venue":null,"work_id":"4a50e314-1969-46f7-a0ff-3a56c286ec6f","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.238307Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:6acfec62c11cc10df35699635511701ce3841da699fa27fb65b1f0b6d6e5c993","observation_id":"7c342753-40eb-4017-bf82-1731b4feda72","resolution":{"observed_at":"2026-08-15T21:55:22.936977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.916964Z","title":"Self- supervised Object-centric Learning for Videos","venue":null,"work_id":"800fb848-93b5-4412-ba9a-330a3c3bcfbe","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.244208Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:08c04bd55feaabf874efb5fb6b37d924ca1f7880a0b21dc09ce36730c4d884b2","observation_id":"cf2d989e-2bff-4181-9ae4-de3868240580","resolution":{"observed_at":"2026-08-15T21:55:22.921945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.900204Z","title":"Adamae: Adaptive masking for efficient spatiotempo- ral learning with masked autoencoders","venue":null,"work_id":"998195bc-e83d-4d24-b5b1-ab4a64c88842","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.249736Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:7047115179689c45ed7232de3aa2d874e85e6605a52056ea2af12fc847ddb25a","observation_id":"1a4c6e03-ae63-4004-bd31-c3fe5a44f651","resolution":{"observed_at":"2026-08-15T21:55:22.905957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.883224Z","title":"Clustering on the unit hypersphere using von mises-fisher distributions","venue":null,"work_id":"75879eec-a498-4af6-be96-0cf4cc175476","year":2005},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.255972Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:aaafc39c43adbde6467f38113c811ca16b7898361d31c5a30b27fd1ae8898e4b","observation_id":"a908a89e-89b8-4e53-9a70-a9c96f8e0c87","resolution":{"observed_at":"2026-08-15T21:55:22.888030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.867654Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"c0b7bc92-e040-4ffe-a9af-c9c193889236","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.260922Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:f275806d91f3994dd67799aa2ac4f9ba26e75b43436fd84da9bac4df90ecd60f","observation_id":"f3946730-b2ce-4410-8dde-485a3340ce37","resolution":{"observed_at":"2026-08-15T21:55:22.872732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.851900Z","title":"Improving masked autoencoders by learning where to mask","venue":null,"work_id":"6356259f-0bd7-4667-bf31-d950a74212ad","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.266179Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:3a549faaa76bf8fe37d5e0842e6d14fb1d1f05dabb4df6870ade7548c427c038","observation_id":"8fabecb0-6e89-43c1-9808-4e64e066f88d","resolution":{"observed_at":"2026-08-15T21:55:22.857099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.836722Z","title":"Generative pretraining from pixels","venue":null,"work_id":"7261295d-648f-4b58-ac0b-2b161327fc44","year":2020},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.270802Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:4abc78fd2978194eb4cf2efcfbd20df2df2ad3223ff52f73371daf45f2b43a6d","observation_id":"40c0d332-7c81-48f4-b74c-74cce651107e","resolution":{"observed_at":"2026-08-15T21:55:22.841668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.821976Z","title":"Dynamonet: Dynamic action and motion network","venue":null,"work_id":"7b4ad446-263c-4ae9-9035-a0dda6d0a6d1","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.275462Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:e5c3e1d85a5d814ec0b4802c5768578f31d77087313e6bcc28c9b09cef461d8f","observation_id":"aa78ea1d-5f7f-4393-bd42-7d857d98639d","resolution":{"observed_at":"2026-08-15T21:55:22.826487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.279864Z","title":"Peco: Perceptual codebook for bert pre-training of vision transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.279864Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:a05673a95c895f06d9327d3131ee7631edc9579d1911c9db4d3fcfbd0ca39b7a","observation_id":"e0cc744e-9ffa-4f53-8fd3-e87d1c9021a5","resolution":{"observed_at":"2026-08-15T21:55:21.279864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.797066Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"73836e46-37a6-441e-95c1-efb36b6ce3a3","year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.284600Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:87d7717fefbb6f797c8732d82af6b8aed0fda39ea0a1e1b5b29492b2f25a8d04","observation_id":"e6c2c009-414e-4f9b-8611-d0684ee20355","resolution":{"observed_at":"2026-08-15T21:55:22.801665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.782748Z","title":"Motion- guided masking for spatiotemporal representation learning","venue":null,"work_id":"3382171c-d6f5-4ca8-868e-f7057c852230","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.289604Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:b5334fdfe53fc127d48d7556b82ca5e8e4c0aa1aa8ff5c6f18f0103b8a49fa12","observation_id":"a8d8bbff-4149-4aaa-88ad-2e86f739f106","resolution":{"observed_at":"2026-08-15T21:55:22.786983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.767598Z","title":"A large-scale study on unsupervised spatiotemporal representation learning","venue":null,"work_id":"a09a2a12-04fa-47ff-a957-e12dac1a3818","year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.294333Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:c8dd720a509737a4df77f5063bb7439948a39216dd8a938acd82c3939be04a22","observation_id":"26fc7600-3081-431a-a748-af829ae4e389","resolution":{"observed_at":"2026-08-15T21:55:22.772537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.298798Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.298798Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:297746ef40754cf887e4e539c3a3cbfbfe7d84f6409a7a9e4baa2404c32858b8","observation_id":"c73e85c8-c50c-4b60-84c0-3b1c4ef79649","resolution":{"observed_at":"2026-08-15T21:55:21.298798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.742189Z","title":"Evolved part masking for self-supervised learning","venue":null,"work_id":"31b8b62b-60df-4c68-8c2d-a75f3a2924be","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.303291Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:73226d25c788387988a7dd48dac33b431438e0eba49a1c3246e854eccee5bb5f","observation_id":"dccc737d-1951-4486-a59b-b3d0a11d73a6","resolution":{"observed_at":"2026-08-15T21:55:22.747358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.727157Z","title":"Self-supervised video representation learn- ing with odd-one-out networks","venue":null,"work_id":"a9450e16-3660-4591-8c7a-63a318131f9d","year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.307835Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:2bb0abcbf4ffc91a4e02dff006d6d7ca3c548aff43e9a611f49ac5600b1ab8d7","observation_id":"49ce48f5-f03d-4abf-9c54-aa03f83cfe47","resolution":{"observed_at":"2026-08-15T21:55:22.731987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.711880Z","title":"Omnimae: Single model masked pretraining on images and videos","venue":null,"work_id":"09af3459-56ff-4955-955a-d391c8e4a93c","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.312326Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:ee8c21e8dcbbf74307caa6f23aa4705cde027d82746055873eac79da52577b6b","observation_id":"602587dc-2f1b-4755-afbb-9cde839747d9","resolution":{"observed_at":"2026-08-15T21:55:22.716772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.696494Z","title":"Reinforcement learning for language mod- els","venue":null,"work_id":"113b3973-80d0-43ad-8e03-e0e2877b99fc","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.316743Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:fd7ccd6b3d1ed5ebb10d2fe6141e9cb932327f5e455f74e3a9b5c614c47f65b2","observation_id":"9f219456-65fd-4bad-bf76-141f15ba2df5","resolution":{"observed_at":"2026-08-15T21:55:22.701744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.681727Z","title":"Unsupervised learning of spatiotemporally coherent metrics","venue":null,"work_id":"c6547b31-4c14-4216-be89-06060898cbfe","year":2015},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.321421Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:d79f349a29441237b13729f360b69af254babebe74f8823bf70001ac5747db8f","observation_id":"fd42de66-1e6f-445e-9faa-b2734348f35d","resolution":{"observed_at":"2026-08-15T21:55:22.686644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.666683Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"c0365e4d-bbbf-417e-834d-af2a0b81774b","year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.326072Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:cdf0cdf953eea359b4e66d9f18d5c6b4fa43f10e4b52078e35b39060e9a4f2fb","observation_id":"efb2d874-002c-466d-9828-e98f75ee0e42","resolution":{"observed_at":"2026-08-15T21:55:22.671660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.651494Z","title":"Video repre- sentation learning by dense predictive coding","venue":null,"work_id":"9c447189-6bb4-4ef1-a81c-158c26c65c96","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.330690Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:c7552bf0f545d80c3a0f9bf1f73d0c32ea05e96b41f91e651150ee0b3f8f6f51","observation_id":"1c56b44f-83d5-47d5-a4ce-b4e65c4331f6","resolution":{"observed_at":"2026-08-15T21:55:22.656308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.637941Z","title":"Self- supervised co-training for video representation learning","venue":null,"work_id":"3e542667-3672-4fc6-943e-7af922c09abc","year":2020},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.335223Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:e439aa74af82f687060a0de939d002b834babafb3789effc1a582107d81cbebb","observation_id":"d7fa5d87-302d-46a6-9d19-9bfef0ae0c1e","resolution":{"observed_at":"2026-08-15T21:55:22.641950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.624041Z","title":"Masked autoencoders are scalable 9 vision learners","venue":null,"work_id":"bc25eafb-49e3-4768-87bd-3a88e24e12e1","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.339857Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:e7704e9646b28711e20c85fb3babbe5c44a99f5cf80426f6600d7ae6959bd263","observation_id":"c29b23f2-ebc8-4026-8044-229c5c797b27","resolution":{"observed_at":"2026-08-15T21:55:22.628358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.608887Z","title":"Using self-supervised learning can improve model robustness and uncertainty","venue":null,"work_id":"5cb7fcae-6251-4d01-b1d2-55cd466867dd","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.344302Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:12baee59009367a752fb473ed31aae174889969561b6e513548acc12c94323f9","observation_id":"3be9baad-e4a4-4af1-8067-7d647389d279","resolution":{"observed_at":"2026-08-15T21:55:22.613390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.593392Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"272ada0a-0f5a-44d8-aa26-21cb155b3f6b","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.348970Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:214c31d6203c7d176e54cffa5760baf656737e2f8dd0efd0591c0f90128dbc5c","observation_id":"2c91c85f-4714-40c4-bb2d-26a0195321f1","resolution":{"observed_at":"2026-08-15T21:55:22.598267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.578006Z","title":"Everest: Efficient masked video autoencoder by removing redundant spatiotemporal tokens","venue":null,"work_id":"9272251c-a316-474f-923d-59b1d211a3fd","year":2024},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.353753Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:c4c41e00c23dcde6c2aa115658fe117e49d6c8aef883f1f1ac387efac5a4bd73","observation_id":"aab6526b-9d3c-4009-9ff9-81c371c51f42","resolution":{"observed_at":"2026-08-15T21:55:22.583153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-15T21:55:21.358356Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.358356Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:53faf7c5daaf595c1e986acc33f9b07287ece2f7f0e248fa0a75ee448907da8b","observation_id":"7855792d-54bc-4f48-8396-06e78e46c649","resolution":{"observed_at":"2026-08-15T21:55:21.358356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.561972Z","title":"What to hide from your students: Attention- guided masked image modeling","venue":null,"work_id":"9d11b175-bc75-430e-9b44-00043d7551a3","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.363766Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:3e9ebf82610a0ccb1317d9255024904844c02d4482dbcdf6456f23cac00f52dd","observation_id":"afcc3b9e-c644-4b97-81b7-065c645dc4d2","resolution":{"observed_at":"2026-08-15T21:55:22.567083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-15T21:55:21.368747Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.368747Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:5e4274b3b4f87930e6842dd3343d20c3e82857a759f055c69f3b557b4e84f8ac","observation_id":"9f27fe6e-d582-4781-b6c4-c21d96642c9d","resolution":{"observed_at":"2026-08-15T21:55:21.368747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.544984Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"3eef3315-8539-4461-9c71-742ca525c883","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.374429Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:69384f7a6d21ffb11942c2c892b0e50c6506ee00b3ffa8108574654a878616ac","observation_id":"aaa9e343-87b6-4480-b528-4f3f9cf10137","resolution":{"observed_at":"2026-08-15T21:55:22.550534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.531149Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"f183199e-64a6-4c09-8afb-47477be4b1ad","year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.379070Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:b0bbb1e72d3ac6c482c06ae51bf383a34a64694932fd6523a2760ae9e17c166b","observation_id":"b7be5f72-fe6d-416b-b3d2-0d21401e4f06","resolution":{"observed_at":"2026-08-15T21:55:22.535250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.516966Z","title":"Unsupervised representation learning by sorting sequences","venue":null,"work_id":"fdec8ce5-f9c2-4be7-88a4-7bc3da52e9bb","year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.384829Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:fcfe215df540bd372941dbac6561c680f3d5f087b642683f95da68fd592aeb29","observation_id":"a62873de-d529-401f-9eca-2bb005eade60","resolution":{"observed_at":"2026-08-15T21:55:22.521298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.501262Z","title":"Semmae: Semantic-guided mask- ing for learning masked autoencoders","venue":null,"work_id":"aca34d24-f3ba-4943-b84a-ea283451595d","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.389225Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:6a4765a0dc2335ae012b3f86df0fb57196f699ed29598c73a55c285dc91e3445","observation_id":"f4e51637-d4b9-40d3-9c10-075b8775bbe8","resolution":{"observed_at":"2026-08-15T21:55:22.506685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10063","last_updated":"2022-05-20T10:16:30Z","snapshot_observed_at":"2026-08-16T16:58:57.122016Z","submitted_at":"2022-05-20T10:16:30Z","title":"Uniform Masking: Enabling MAE Pre-training for Pyramid-based Vision Transformers with Locality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10063","snapshot_observed_at":"2026-08-15T21:55:21.393495Z","title":"Uniform masking: Enabling mae pre-training for pyramid- based vision transformers with locality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.393495Z"},"links":{"cited_paper":"/paper/2205.10063","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:2513e0245ca1578f517d45e562c50eb7f80eea87812e0a8a707c441d18550e7b","observation_id":"b9cbab6a-c058-45d4-babb-5dee076270d1","resolution":{"observed_at":"2026-08-15T21:55:21.393495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.483505Z","title":"Deep predictive coding networks for video prediction and unsu- pervised learning","venue":null,"work_id":"dcef10e9-57cf-412f-bc38-b19a25d5038d","year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.398505Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:e498767b9e65a866993e25c61e53331a9579edc5580f0fca4c51a4f8b0728432","observation_id":"063d91a8-9d80-4dba-9d63-6074ce889b21","resolution":{"observed_at":"2026-08-15T21:55:22.488841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.467187Z","title":"Cl-mae: Curriculum-learned masked autoencoders","venue":null,"work_id":"ae78784b-e577-4a71-9c13-3d0fdab2735f","year":2024},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.403165Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:dafe8f1ed36b3ab1b9d7fdcd62ab15dc70605fc5a32e553a2a5896744c36e144","observation_id":"ed48cf8f-a264-44ab-9828-d2cf89339c2f","resolution":{"observed_at":"2026-08-15T21:55:22.472549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.450712Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":"d9cf1185-d803-4f01-8220-4379293bb2d7","year":2016},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.407824Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:72ccde71ee292dfc0554c0b633d4f38194fdfdaadb42976f45349b04918fd6ce","observation_id":"66401026-9a94-4be3-9c84-6a6d4dce65cd","resolution":{"observed_at":"2026-08-15T21:55:22.456123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.435230Z","title":"Shuffle and learn: unsupervised learning using temporal order veri- fication","venue":null,"work_id":"679f8cb2-3e11-4c81-82e0-dfc8bb1c6556","year":2016},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.412537Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:d1d0e58844611691da8f680b752a5e4c531e12d3b410b47137620d8e3e933aa2","observation_id":"1e72860e-e54c-45b1-82a2-d3f01d27b3d9","resolution":{"observed_at":"2026-08-15T21:55:22.440100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.419561Z","title":"Oswald, Alexander Kirillov, Cees G","venue":null,"work_id":"227bc620-2a9b-4959-b063-b726b3205f0f","year":2024},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.417478Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:5384e51d28f349012d7aef62bee7441622f0c7af535f69bb2d1929d22a1abbad","observation_id":"f76d39d1-452d-4d92-92f9-f98cf19aa301","resolution":{"observed_at":"2026-08-15T21:55:22.424699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.422423Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.422423Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:4bfdd8ccebe59158197eff24a5ab6febaf9733ab045e389877b74bb0e431beb7","observation_id":"d96bb54e-0cbc-4964-9a3a-61b33d0cdbc4","resolution":{"observed_at":"2026-08-15T21:55:21.422423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.394017Z","title":"Learning features by watching objects move","venue":null,"work_id":"95453093-89f5-48aa-a879-aff124615d0f","year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.427072Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:7a0ce80dd65cdbfb149b51461aaf8ef0bd142991282da41cdfaebe01be61feb7","observation_id":"f6815896-74e7-4a66-8d98-e5bf5f7ffbaa","resolution":{"observed_at":"2026-08-15T21:55:22.399046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.377407Z","title":"Keeping your eye on the ball: Trajectory at- tention in video transformers","venue":null,"work_id":"3b3ec4cb-499d-4622-9f9c-627c848e2238","year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.431640Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:8cbd03b7572c09d743116b9c163b3d1bcfb05931ca4af1fe9c7af94e829e88ba","observation_id":"5745f6dd-25b5-42a8-8313-b22a528423d6","resolution":{"observed_at":"2026-08-15T21:55:22.382879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.436800Z","title":"Spatiotempo- ral contrastive video representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.436800Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:339641da296c215063fff3fa03a366ece279eb430a09d2af2d309408d644080d","observation_id":"cf4196cd-9df5-457e-b0aa-ba29e603b4d7","resolution":{"observed_at":"2026-08-15T21:55:21.436800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.351567Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"3f2284fe-96df-47d6-aaa8-612f4f3dd102","year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.441850Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:10ec02db39a14f139c177f9373a96750758459da2fbcceb33cdf6261c4a3b282","observation_id":"59138987-f182-4563-a1e2-e1c46b18cd87","resolution":{"observed_at":"2026-08-15T21:55:22.356614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.446515Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.446515Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:bd14b5d5e5eadf071e9797cc0e7cf48cb34f04cd72555de1c6cc3cc799159b78","observation_id":"f4ae26ec-5c87-4f62-9f0a-f77ef7c8ebe9","resolution":{"observed_at":"2026-08-15T21:55:21.446515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:55:21.451455Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.451455Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:26a9ffff31bd28ff1ec832d80918898401d5e73ff2a90d422013d50ca6999aab","observation_id":"31ad8e4a-5e9d-4381-b745-f67c54c2a720","resolution":{"observed_at":"2026-08-15T21:55:21.451455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.327119Z","title":"Adversarial masking for self-supervised learning","venue":null,"work_id":"fb568908-5c0b-4f37-a13b-041d43c46c6b","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.456367Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:97fd097e53a3b9ebc1e9567efe46c4177d8142aef005bd9f71f7b5412afe943f","observation_id":"d55fd36d-48ff-4fe3-9ab3-e8fdf3907b7b","resolution":{"observed_at":"2026-08-15T21:55:22.331515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-15T21:55:21.461287Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.461287Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:31379c39cb3a153350e98a030c4f142d6418a4f2794379e7f7165ba07a1eda93","observation_id":"e3d7e413-fe2e-4c50-a0d6-628f3deb2e55","resolution":{"observed_at":"2026-08-15T21:55:21.461287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05743","last_updated":"2019-09-27T21:59:59Z","snapshot_observed_at":"2026-08-14T16:43:08.838362Z","submitted_at":"2019-06-13T15:03:52Z","title":"Learning Video Representations using Contrastive Bidirectional Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05743","snapshot_observed_at":"2026-08-15T21:55:21.466300Z","title":"Learning video representations using contrastive bidirectional transformer","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.466300Z"},"links":{"cited_paper":"/paper/1906.05743","citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:98e7fe1269a7a94e3359269edd47c92d3f7f2d2a0d80f235e25ffa25fe2162fe","observation_id":"c4edf3dd-42e5-4a5e-9843-a4082010dd57","resolution":{"observed_at":"2026-08-15T21:55:21.466300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.308899Z","title":"Masked motion encoding for self-supervised video representation learning","venue":null,"work_id":"2987b8ba-154b-4f9b-8307-0d637547d9db","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.471756Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:1a56acfa1f2ef36c2a1facfde20139803569d7001b31026f5761194cc44dddcf","observation_id":"022db088-2d15-412c-b117-5bfd2d0885cb","resolution":{"observed_at":"2026-08-15T21:55:22.314528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.291466Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"8648b75a-7542-40fa-a859-902cfcde5310","year":2020},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.476322Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:e10073b6063351acc25395e1f4763753bfd19d24d130ba9efd43f222bb8f8831","observation_id":"aba5a830-a61a-4562-89a4-75e8a4214508","resolution":{"observed_at":"2026-08-15T21:55:22.297064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.274908Z","title":"Video- MAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"945827d4-f3bb-410a-bafd-3b6d1a617641","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.481855Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:17158211935a19269c09fe232c7a3ee24ccb8521c76e29dffc8ec72e3a393e85","observation_id":"9631e057-8b94-4cb4-975f-b82bd14d3dc5","resolution":{"observed_at":"2026-08-15T21:55:22.280299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.486544Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.486544Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:82aa7121e8642fc1c9dad09bca78f863925ae7b6ff5c1ef149c51da5d88781a3","observation_id":"172285a1-73ad-4df9-9155-92ec820ec08b","resolution":{"observed_at":"2026-08-15T21:55:21.486544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.491586Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.491586Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:3631cb8c5188f1816f209e9a627c4f27a7c34f09369e3aea27a221698917e7db","observation_id":"4157729b-29f8-492d-8c72-081523efb4dd","resolution":{"observed_at":"2026-08-15T21:55:21.491586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.237405Z","title":"Extracting and composing robust features with denoising autoencoders","venue":null,"work_id":"e266dfbc-d0a8-45bb-b7b6-120409d57e4b","year":2008},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.496147Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:d4d9a3368587c517a047bd5f968452974ff34d76751d51fb2b47665adfea0186","observation_id":"74fce342-f55a-4cf8-b249-239d36dc94ea","resolution":{"observed_at":"2026-08-15T21:55:22.242196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.220771Z","title":"An- ticipating visual representations from unlabeled video","venue":null,"work_id":"da7487f1-5df7-488f-9f85-04ec97c49f96","year":2016},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.500837Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:27db5714eab97e614d6191766b8aac2a20fb6a5bb007f551f0ae11d1d6758632","observation_id":"d54e986b-6ba1-4978-aef7-c6a75364ce3c","resolution":{"observed_at":"2026-08-15T21:55:22.226590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.110760Z","title":"Tracking emerges by col- orizing videos","venue":null,"work_id":"36c7bb3f-37c5-43e0-bb3c-a43c9fe364e2","year":2018},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.505625Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:1b4be0e046bf6b3f79f2f4a9110a09203166debf969878bf6a44ac3b67e90114","observation_id":"13c01e24-7eec-41e1-85de-b53cca3c332c","resolution":{"observed_at":"2026-08-15T21:55:22.170184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.094460Z","title":"Self-supervised spatio-temporal representation learning for videos by predicting motion and appearance statistics","venue":null,"work_id":"d8c25a17-baa5-4ebe-9966-e0213273fe81","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.510955Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:c7322ea2eae1aeccba57569be7105334a84e84b4267ecdbe26f8da1865d5e13f","observation_id":"12f63dfb-5c89-41b1-8696-7668dd521ae1","resolution":{"observed_at":"2026-08-15T21:55:22.099994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.076712Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"37afb2b5-a839-4dc7-a44e-4279b0f125cb","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.515456Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:8243ab7d4cff277f543f8df81fdad976b4c84245194bababb25576ab9ee3c5f6","observation_id":"c717fb67-d06b-47eb-98e6-43e0daf7e394","resolution":{"observed_at":"2026-08-15T21:55:22.082787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.059889Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"26b955e9-d146-4d37-a34e-e041bcf36582","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.520682Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:5fefd657c5413ce80f444b0f007d30634b48222f9686e03f538294441e6ceb00","observation_id":"b3e59620-f5c3-4a88-bc0a-e36e7a6aba4a","resolution":{"observed_at":"2026-08-15T21:55:22.065414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.043637Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":"771fc6f5-1e26-4647-93f2-225c48b5ed44","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.526018Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:bccdce5ad6601084024b65a267bfb0f0dd45769f2645d1fc23e59aee94dec22f","observation_id":"4b69c861-14b6-43ab-a7b2-bba6b1f91b47","resolution":{"observed_at":"2026-08-15T21:55:22.049126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:22.022709Z","title":"Unsupervised learning of visual representations using videos","venue":null,"work_id":"36751bba-5345-471f-bc42-46a965cfb60d","year":2015},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.530780Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:bad96193a8fecb5b3c925b6f0172ef6d3f40541ab74e05874fef47ea15d5cc54","observation_id":"f0dd86e0-dd55-47f1-a485-7b0bc45e6604","resolution":{"observed_at":"2026-08-15T21:55:22.032115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.989294Z","title":"Learning correspondence from the cycle-consistency of time","venue":null,"work_id":"58200386-2b8c-4cb6-865f-3d058e66674e","year":2019},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.535511Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:97e46ae687cf37d2d5dc14ca811532b650003c454a47302d86b9f4ef868ac732","observation_id":"0620a0f1-3273-462e-a129-5cecb358ec23","resolution":{"observed_at":"2026-08-15T21:55:22.002449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.950272Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":"561642f4-f3e3-4adc-b369-0376b47ad5fb","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.540871Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:0fe3f9ba4e814d1e0a643205ddbb199d9341763b881a6b47f98531ccee310a8f","observation_id":"adc99540-6c9d-4b5b-96e2-1dab3041796a","resolution":{"observed_at":"2026-08-15T21:55:21.955567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.933068Z","title":"Learning and using the arrow of time","venue":null,"work_id":"774aea51-2435-48e5-b365-b47c7bd5e647","year":2018},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.545577Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:b69539544fa2947278982e38cec619e8be1ea1a2d1a83870953df2d530fcae6a","observation_id":"82348a76-1cff-4ac7-a71e-9104452b7700","resolution":{"observed_at":"2026-08-15T21:55:21.939267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.914924Z","title":"Efficient vision- language pre-training by cluster masking","venue":null,"work_id":"27155778-8469-4daf-b3de-8bac55530222","year":2024},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.550600Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:1a9d321b36ae0863af20104f08f6e526d70145da4647fd367dc91cd107cbb4be","observation_id":"12651564-55af-4dcf-a1ee-1e0994462feb","resolution":{"observed_at":"2026-08-15T21:55:21.920862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.897092Z","title":"Williams","venue":null,"work_id":"5fabd26c-8e7c-43c0-9583-d6508b537280","year":1992},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.555760Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:ff1fd5a72b1c9649e2935597404a6e2659c2fb9f843a9bf0413b3a4eade05c8c","observation_id":"9913fb91-343c-47fe-8e8f-1aa7da67174f","resolution":{"observed_at":"2026-08-15T21:55:21.902411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.880214Z","title":"Slow feature analysis: Unsupervised learning of invariances","venue":null,"work_id":"88716cdb-54ec-487a-8d9a-8094cf9fd06b","year":2002},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.561423Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:6503b0d9b6ace553cee5ced71938766cd05d7abca7008b9be506843708657ed4","observation_id":"446de0e2-b8d3-4ecd-ab48-3706d7737dd4","resolution":{"observed_at":"2026-08-15T21:55:21.884972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.862161Z","title":"Masked frequency modeling for self-supervised visual pre-training","venue":null,"work_id":"cd4525f8-03d8-4abf-a396-ee0129e2236b","year":2023},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.566441Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:f384f999b4e642343647832f20b01a98dda768cb623073a49ef27c0c89805539","observation_id":"17f7758e-e85a-49aa-8f71-3d47434653b2","resolution":{"observed_at":"2026-08-15T21:55:21.868947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.844887Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"217b94d8-773e-4ee0-b5c6-4923b0ad07ec","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.572311Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:b02b299ba7648217b7dede5e43ba07563f93af83848a8849ecbdc1b0912b3e34","observation_id":"4fe288e0-1f11-4637-8ac0-3b87dbcfd13d","resolution":{"observed_at":"2026-08-15T21:55:21.850705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.577435Z","title":"How mask mat- ters: Towards theoretical understandings of masked autoen- coders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.577435Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:ef3be54d060925b9ed850fac8eee2a46ffd1c7088ffba46870ba2b21dd09df26","observation_id":"52cd698a-d424-4650-b2a1-32127a0c9bb4","resolution":{"observed_at":"2026-08-15T21:55:21.577435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.814494Z","title":"Image BERT pre-training with online tokenizer","venue":null,"work_id":"6a326a80-3861-4a95-ad23-493782ed5936","year":2022},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.581982Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:96bc278b8f792a374b523b9c8a1cf7033e449f2d285db99f103dc13c2497a81e","observation_id":"e78b7c37-b539-44ca-a3c0-cb69f9262175","resolution":{"observed_at":"2026-08-15T21:55:21.819842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.796389Z","title":"Each video depicts a single action with a duration ranging from 2 to 6 seconds","venue":null,"work_id":"7166f6cc-5b53-4e01-a53b-2e56d4d86c4d","year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.586648Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:f166e2eeab2a22435a317507d51086d607fb5c0fd1b7826e94e0c5c16eb14f92","observation_id":"c250d101-8781-4096-8bec-ace125e506e0","resolution":{"observed_at":"2026-08-15T21:55:21.802527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.778501Z","title":"Data Preprocessing Our data processing pipeline closely follows AdaMAE [4] for pre-training","venue":null,"work_id":"4044b207-01b3-4d47-9d4a-a0f8ccebdee8","year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.592155Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:f06fdf354303595d4070afd6573a7834e87dfa7139eedd2f4c466c95f68bd344","observation_id":"9b7a02ea-4b96-48a7-b830-072355ec7428","resolution":{"observed_at":"2026-08-15T21:55:21.784743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.761457Z","title":null,"venue":null,"work_id":"6b1d9522-0265-4791-b180-a9ac49368e38","year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.597248Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:3e41d89ff29be3e0f3f10b3ad47c2d57ae156344eca91e73b0c6d941c8251406","observation_id":"651237d2-40a2-4c09-9978-bef3cdb967eb","resolution":{"observed_at":"2026-08-15T21:55:21.766661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:21.741139Z","title":null,"venue":null,"work_id":"592a6a53-89d0-4543-a4bc-9d33a5a55b6e","year":null},"citing_paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:55:21.602712Z"},"links":{"citing_paper":"/paper/2505.08561"},"observation_digest":"sha256:d59b560c90c31cf967b6249498728324e296bda15851148290c8ae0a1dc80ef0","observation_id":"cc5fc016-76eb-47da-b739-5c841254d1ab","resolution":{"observed_at":"2026-08-15T21:55:21.748161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08561","last_updated":"2025-08-14T12:27:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T21:49:24.556575Z","submitted_at":"2025-05-13T13:35:41Z","title":"Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":60},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2505.08561."}