{"as_of":"2026-08-08T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6c6edbd09570122e5f0305fdbe9c934bf1a469f60458d8418b7dddd18254ce7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:27:00.912867Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05543/citation-record","integrity":"/paper/2506.05543/integrity","json":"/paper/2506.05543/citation-record.json","paper":"/paper/2506.05543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06907","last_updated":"2023-10-10T18:03:41Z","snapshot_observed_at":"2026-08-04T05:47:27.508649Z","submitted_at":"2023-10-10T18:03:41Z","title":"Self-supervised Object-Centric Learning for Videos","version":1},"cited_work":{"arxiv_id":"2310.06907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06907","snapshot_observed_at":"2026-08-07T10:27:03.163967Z","title":"Self-supervised Object-Centric Learning for Videos","venue":"cs.CV","work_id":"587af088-b3da-4a40-a987-3ac1f1dd28e0","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.075692Z"},"links":{"cited_paper":"/paper/2310.06907","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f44491b356cb6f2483ea30b43872178bc8de0c3e7f72e3d1a65931acd3d38958","observation_id":"3747041c-8cd9-492d-be05-5258c858e53d","resolution":{"observed_at":"2026-08-07T10:27:03.244802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.09549","last_updated":"2021-12-01T19:21:43Z","snapshot_observed_at":"2026-07-06T05:01:56.557493Z","submitted_at":"2016-06-30T16:00:43Z","title":"Fully-Convolutional Siamese Networks for Object Tracking","version":3},"cited_work":{"arxiv_id":"1606.09549","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.09549","snapshot_observed_at":"2026-08-07T10:27:03.015453Z","title":"Fully-Convolutional Siamese Networks for Object Tracking","venue":"cs.CV","work_id":"bf69cd29-ff59-4edc-b237-ba8d2b6ef361","year":2016},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.143077Z"},"links":{"cited_paper":"/paper/1606.09549","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:71059f027880af3a53b053c4197055d8ec9bc98a21cff231a59f82ff2c84b404","observation_id":"dec122db-7350-433f-8049-759b4eb3a591","resolution":{"observed_at":"2026-08-07T10:27:03.060266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.999675Z","title":null,"venue":null,"work_id":"b9b540e1-b88f-4b3a-bd95-82feb7fe2a3f","year":2008},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.207833Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:cf6e122efb740ec2a26016e065389b8503d874a30c2638f0255b9f944efd114e","observation_id":"241f286c-143a-41d6-aad5-4fc4f5104a5b","resolution":{"observed_at":"2026-08-07T10:27:04.002367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-08-07T10:26:56.327573Z","title":"Caron, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.327573Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:91dd023963e03efbff9aef6c340a6fb4300deead45ab47f509a7d678423d56a8","observation_id":"9d7786a1-03c0-4b7c-9345-89b60baab0f6","resolution":{"observed_at":"2026-08-07T10:26:56.327573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-07T10:26:56.430091Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.430091Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:93f161fc9bda110f4342f3a3ede62dcd32ad91b080049e950277b337da93dce8","observation_id":"136b593e-054b-40c0-8cba-1e6c5ac50521","resolution":{"observed_at":"2026-08-07T10:26:56.430091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10566","last_updated":"2020-11-20T18:59:33Z","snapshot_observed_at":"2026-08-02T22:08:29.872490Z","submitted_at":"2020-11-20T18:59:33Z","title":"Exploring Simple Siamese Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10566","snapshot_observed_at":"2026-08-07T10:26:56.652735Z","title":"Chen and K","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.652735Z"},"links":{"cited_paper":"/paper/2011.10566","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:d4705f66850b40e222963763d8c4e7fb099f2783848ecc50f490efc10a9708ff","observation_id":"5c9830a1-1da1-4750-ab2b-2dfec7727654","resolution":{"observed_at":"2026-08-07T10:26:56.652735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03903","last_updated":"2023-09-07T17:59:41Z","snapshot_observed_at":"2026-08-02T23:18:16.636904Z","submitted_at":"2023-09-07T17:59:41Z","title":"Tracking Anything with Decoupled Video Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03903","snapshot_observed_at":"2026-08-07T10:26:56.755323Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.755323Z"},"links":{"cited_paper":"/paper/2309.03903","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:e61c40581cec382d681fb077252947a21370171990301392a8588222255aad5c","observation_id":"cca99645-80ee-476b-819f-e7e2ec483e01","resolution":{"observed_at":"2026-08-07T10:26:56.755323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12982","last_updated":"2024-04-11T22:47:39Z","snapshot_observed_at":"2026-08-02T06:01:20.356934Z","submitted_at":"2023-10-19T17:59:56Z","title":"Putting the Object Back into Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12982","snapshot_observed_at":"2026-08-07T10:26:56.844695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.844695Z"},"links":{"cited_paper":"/paper/2310.12982","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:9f5d365dcea317611358d972b79accaf880b9de5dfa8de14d3e4f3f5e12b416e","observation_id":"f613318c-2866-40df-a95f-55976169af5f","resolution":{"observed_at":"2026-08-07T10:26:56.844695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.991384Z","title":null,"venue":null,"work_id":"ecec68dc-2811-4b19-8d55-aa91ba0df888","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.935230Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:990ba5bc6bcb6c558c04896ebc2a2abfca39bbad077684a61b5473866d094a35","observation_id":"8272b971-cc30-4a9e-b18a-7d640c83a150","resolution":{"observed_at":"2026-08-07T10:27:03.994420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.983044Z","title":"Doersch, A","venue":null,"work_id":"1f650bc8-8734-4015-be26-1eaf8097d214","year":2015},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.058328Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:d53f40881353f0f8bcfc7f194b3dbe4a4a56654cccdcd87cfd4ea249131e55b7","observation_id":"8725609c-f12c-4f4b-882d-156bb4d77ae9","resolution":{"observed_at":"2026-08-07T10:27:03.985668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.974811Z","title":"Eymaël, R","venue":null,"work_id":"fefdf809-3779-4c7b-8745-95d6e6caa67d","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.154505Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:d39232c0bd740d40f9b9783bf830d19049bd45ad196ec19a47073f2a46d1cebf","observation_id":"0433ac2b-f287-49f3-a4bf-5ea004b69a6b","resolution":{"observed_at":"2026-08-07T10:27:03.977742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14558","last_updated":"2021-04-29T17:59:53Z","snapshot_observed_at":"2026-07-06T11:04:54.528420Z","submitted_at":"2021-04-29T17:59:53Z","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","version":1},"cited_work":{"arxiv_id":"2104.14558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14558","snapshot_observed_at":"2026-08-07T10:27:02.747459Z","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","venue":"cs.CV","work_id":"40f34868-2033-4d31-9232-ba586aa5df07","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.235226Z"},"links":{"cited_paper":"/paper/2104.14558","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:ec7b394b5093e13eed186bf227f2b46381b7fba63a71b3dbfee7438e72153dc5","observation_id":"e26bfb12-99b0-4ff8-91e5-7094c69b37fa","resolution":{"observed_at":"2026-08-07T10:27:02.867254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.965905Z","title":"Grauman, A","venue":null,"work_id":"36233c2e-fd55-4f1b-af21-16adf9faa1bc","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.306125Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f35042540fab1ce9e9b70939e675d5652178e4b48f3ef6bcd325755ae2cebc9b","observation_id":"ce2c6fce-6f4e-4aac-82f3-a201add82bc6","resolution":{"observed_at":"2026-08-07T10:27:03.968950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.957101Z","title":"Gupta, J","venue":null,"work_id":"1fcfd291-d7e9-4ac0-a691-64d6456044f8","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.390376Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:0618fd08206176ebc1f48271c7d05df4c40c8cd73478b60725a83e304aeab166","observation_id":"6d00ed5d-2980-49be-8e70-6a311b2d186d","resolution":{"observed_at":"2026-08-07T10:27:03.960068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-07T10:26:57.500232Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.500232Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:2936e825082f4c19f0572b58862a8065060ba0c426fa220c79b766da9e9d1c6e","observation_id":"a4c8d04b-9d96-4fb1-af2c-d3cdb9c0ef66","resolution":{"observed_at":"2026-08-07T10:26:57.500232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.948363Z","title":null,"venue":null,"work_id":"3ebb27a6-19c7-4167-aa25-abddac3e5341","year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.569273Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c024012a9a003e8bafd0653c9f2b6f98ae14fffdc794588f9e6390dff520f4f0","observation_id":"f4ab7a08-36a7-4184-bfe3-f99d8183d1d3","resolution":{"observed_at":"2026-08-07T10:27:03.951006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.940037Z","title":null,"venue":null,"work_id":"65970ad4-f3bc-476a-85ca-9cc62281249d","year":null},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.640645Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:fedcbc332d6b0a5b47e10540cdbdeec76d8c0eb9d6555ed61a468f3f68f7af4e","observation_id":"e4a6811e-1fd1-463e-b401-2314274aeabd","resolution":{"observed_at":"2026-08-07T10:27:03.942775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14613","last_updated":"2020-12-03T18:59:03Z","snapshot_observed_at":"2026-07-06T09:32:48.916535Z","submitted_at":"2020-06-25T17:56:05Z","title":"Space-Time Correspondence as a Contrastive Random Walk","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14613","snapshot_observed_at":"2026-08-07T10:26:57.863321Z","title":"Jabri, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.863321Z"},"links":{"cited_paper":"/paper/2006.14613","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:1604ad858a3bd11fa65fce28162db2dfa69dd8c9a729d2e80e03ef76c53c3481","observation_id":"15ee4353-4502-46f3-b31a-18fb3f4163e9","resolution":{"observed_at":"2026-08-07T10:26:57.863321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:57.927831Z","title":"Jhuang, J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.927831Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f4a0affa67a7466d85b30165ca5e75216f466c8553e77e5d7bc16201b712b42c","observation_id":"f54fb717-9f43-494a-948f-8ae6e567440a","resolution":{"observed_at":"2026-08-07T10:26:57.927831Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-05T15:59:10.206778Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-07T10:26:57.990243Z","title":"Karaev, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.990243Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:37c7ea6fa9f4cef326551cdac5d4fc2ca5dcd58b03f09fdc48b5f232b8eea836","observation_id":"63aa4cfe-383e-47b3-849f-dd5d24a31edf","resolution":{"observed_at":"2026-08-07T10:26:57.990243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T10:26:58.052557Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.052557Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c042c7c76e3ac0b0e9f24ef4cc07ab5c1ab64ac8b510eac04356c01fb409d935","observation_id":"d94900eb-8934-406d-93ce-d7c2fc3a4cfe","resolution":{"observed_at":"2026-08-07T10:26:58.052557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:02.528296Z","title":"Khosla, S","venue":null,"work_id":"1d4276af-86c1-47f9-bbdf-ea68d732dbcb","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.101630Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:87fa53b48de579337411290df610d4ef62ebca3afd264a72af5e6ab759ba145e","observation_id":"61509798-0e3f-4c3b-b2ff-d3fa8e119566","resolution":{"observed_at":"2026-08-07T10:27:02.610398Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T10:26:58.145168Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.145168Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:59488545fd53b30132c360ca63ef58bea7598a795896bec03d35a4b0afb64d68","observation_id":"3fd45c79-3869-4050-b1c2-fc2e153ac534","resolution":{"observed_at":"2026-08-07T10:26:58.145168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:58.201275Z","title":"Kuehne, H","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.201275Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6162bfd271af4c87ecb2ff9a7580f9fe33a8da937b2d86a6bd04adf390e79043","observation_id":"2daaabb7-c22a-41f2-8edf-9f8b1818bb7e","resolution":{"observed_at":"2026-08-07T10:26:58.201275Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11895","last_updated":"2019-09-26T05:11:26Z","snapshot_observed_at":"2026-08-05T22:46:53.592089Z","submitted_at":"2019-09-26T05:11:26Z","title":"Joint-task Self-supervised Learning for Temporal Correspondence","version":1},"cited_work":{"arxiv_id":"1909.11895","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.11895","snapshot_observed_at":"2026-08-07T10:27:02.271689Z","title":"Joint-task Self-supervised Learning for Temporal Correspondence","venue":"cs.CV","work_id":"b7f1704b-bd86-4c9c-a28a-c496dd4bd6fe","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.239798Z"},"links":{"cited_paper":"/paper/1909.11895","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7703e13f91f600d73a8ba27103a5ebd8023901eacc68b85542a143438bfd6e18","observation_id":"344394e4-3429-49a4-89a9-158b4aaa81a7","resolution":{"observed_at":"2026-08-07T10:27:02.318566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.931883Z","title":null,"venue":null,"work_id":"683719ac-805e-4af5-9e52-35a8941a4e6c","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.315087Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f808ace2a19c22337c415aec902c733b0615ec005c46dd0d143adf12d18c3672","observation_id":"afe415da-e1c5-4bf7-9549-add591fc2b49","resolution":{"observed_at":"2026-08-07T10:27:03.934310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:58.347979Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.347979Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:323e8802e7528ff58c64802e965307499df4aa115cd7d44c299cb69b970b1e59","observation_id":"5d8db677-0ef6-42f1-8878-dd5e2aada7c8","resolution":{"observed_at":"2026-08-07T10:26:58.347979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.924202Z","title":"Misra, C","venue":null,"work_id":"4d840bf0-3a54-4580-acaa-ef83b20af815","year":2016},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.418402Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6fbf21d2dbc2993c73d8bb245071781408ccd8f0171e1c88e106cff72d49e113","observation_id":"916fd0e2-a0a5-4594-bcf8-77e410fa51c5","resolution":{"observed_at":"2026-08-07T10:27:03.926676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T10:26:58.495985Z","title":"Oquab, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.495985Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c78714c18825e95e70c64d76a08c0559bad55e4c99feb9c57de82274267293da","observation_id":"3b7a744a-7df0-48b2-b03e-9fbcea87adef","resolution":{"observed_at":"2026-08-07T10:26:58.495985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T10:26:58.556924Z","title":"Pont-Tuset, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.556924Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:565f21b79bdf133d52e5c6b42911d8d99e30b335742ad93d577c50b1d2312ea4","observation_id":"42c73411-c453-4acc-be82-4f89be80b56f","resolution":{"observed_at":"2026-08-07T10:26:58.556924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.915846Z","title":null,"venue":null,"work_id":"dd6ed747-09ad-4a02-96f7-8aaddb06d845","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.650435Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:643ec94be935556f62a762c82bf3c71a536a1e7a75ecd0538c53fd09da8b7dae","observation_id":"76778535-a78d-40ee-991e-bd8795000eb3","resolution":{"observed_at":"2026-08-07T10:27:03.918396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T10:26:58.719677Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.719677Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:02f76c432eb189ac47bb0dafa35c2bddfbadec30a3b0dca3643a32973d1caef1","observation_id":"c6cc08d7-bbfa-4765-9ecf-de748d330a6f","resolution":{"observed_at":"2026-08-07T10:26:58.719677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.907289Z","title":"Ranasinghe, M","venue":null,"work_id":"3c037d3e-3026-4e33-b0ff-4c5ed2ee836c","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.802843Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:8d80cabe10f313347047c82b8b47de852931fff2b55f1c836e9584aba0d657fa","observation_id":"12096951-7ea5-481a-97c3-1c5b1f02b4f4","resolution":{"observed_at":"2026-08-07T10:27:03.910214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.898920Z","title":"Ranzinger, G","venue":null,"work_id":"b46fabf7-22f2-435b-9db4-cc661c357a83","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.847210Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:e16d31a3c2ee788867cf051f0619398566cf3ebf2fe1b5cae0dcd1615eeea98f","observation_id":"652e3848-feb2-48d4-a04c-a985cb022826","resolution":{"observed_at":"2026-08-07T10:27:03.901689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03640","last_updated":"2023-03-26T11:40:16Z","snapshot_observed_at":"2026-08-07T01:42:48.593126Z","submitted_at":"2022-12-06T18:59:58Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","version":3},"cited_work":{"arxiv_id":"2212.03640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.03640","snapshot_observed_at":"2026-08-07T10:27:02.056985Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","venue":"cs.CV","work_id":"618cf4e9-5952-4d4b-962c-8e19b85e8745","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.906976Z"},"links":{"cited_paper":"/paper/2212.03640","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7820f38911fbf8fb310640c306c3522e8a83d3c9847c31b538fea20b2257d913","observation_id":"7a21a2bd-f4da-43b5-b5d5-203e765557a6","resolution":{"observed_at":"2026-08-07T10:27:02.098834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.890700Z","title":null,"venue":null,"work_id":"2e7340a3-29ff-4e68-8b4b-be9df25394a6","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.961025Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:79446ea0be429c48730114df749749db840290bbe6ed27e1880e928bd6be6cb6","observation_id":"cd207a04-67fe-4ffa-a901-cf4d916bc411","resolution":{"observed_at":"2026-08-07T10:27:03.893723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:26:59.026576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.026576Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7476bceca257ccf262a1766c95ee3b0aba0e73b26fd478c506023a6a80263cf7","observation_id":"59beb273-b3c3-423f-9071-09fde54c3d36","resolution":{"observed_at":"2026-08-07T10:26:59.026576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.882725Z","title":"Salehi, E","venue":null,"work_id":"0e979f9b-4ca9-4b56-bffa-0118a4de1982","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.099479Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:0da387ac13723e5c778f688069dd6dd14b0c7c21e7d98bffb12878399c69b42f","observation_id":"608eebaa-edbd-464e-950f-02c5d95ccf1d","resolution":{"observed_at":"2026-08-07T10:27:03.885315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.874167Z","title":"Sameni, K","venue":null,"work_id":"b0385511-b801-43ce-9fb9-d3163dfa8ea7","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.204553Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7452078c91f22d31c288eb7f8aa7d848866590487260351bb4801f42d776cfe5","observation_id":"1ce80e29-79f4-4392-8aa9-50d17e1f2385","resolution":{"observed_at":"2026-08-07T10:27:03.877127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06888","last_updated":"2018-03-20T01:02:45Z","snapshot_observed_at":"2026-08-06T23:17:14.219606Z","submitted_at":"2017-04-23T06:03:56Z","title":"Time-Contrastive Networks: Self-Supervised Learning from Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06888","snapshot_observed_at":"2026-08-07T10:26:59.275835Z","title":"Sermanet, C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.275835Z"},"links":{"cited_paper":"/paper/1704.06888","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:734240790aec817b373c52d8c5dd58310c6b877225c62487ed317152b2a54516","observation_id":"b57555d6-8a01-4aba-bf93-5214b165c6dc","resolution":{"observed_at":"2026-08-07T10:26:59.275835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02352","last_updated":"2024-06-09T23:21:28Z","snapshot_observed_at":"2026-07-31T18:19:30.018367Z","submitted_at":"2024-02-04T05:33:04Z","title":"Region-Based Representations Revisited","version":4},"cited_work":{"arxiv_id":"2402.02352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02352","snapshot_observed_at":"2026-08-07T10:27:01.853821Z","title":"Region-Based Representations Revisited","venue":"cs.CV","work_id":"3b15c0c3-db35-4d77-a610-7a776ba0c263","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.295328Z"},"links":{"cited_paper":"/paper/2402.02352","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6fc153ac6c23e20206319cb200046b9d5d7cb63000f5eb53c286711220e26da9","observation_id":"0621d52f-41f0-41d0-9c51-022ea67875d6","resolution":{"observed_at":"2026-08-07T10:27:01.941110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T10:26:59.394650Z","title":"Soomro, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.394650Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:5b1590e658cc88166ab83199568990665d2657924b6f95c272285fb02abb568f","observation_id":"1c7a520e-a0e3-412a-ba9e-825a4f371110","resolution":{"observed_at":"2026-08-07T10:26:59.394650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-05T00:36:47.095250Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-07T10:26:59.459159Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.459159Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:ca9c3d33a990520cdd8a6587005651e3c527f49ff6c9269206ea45cfbb3b2ff1","observation_id":"3a3ce278-b861-4ab0-a19b-46b89a94b4c6","resolution":{"observed_at":"2026-08-07T10:26:59.459159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14548","last_updated":"2024-07-11T11:47:26Z","snapshot_observed_at":"2026-08-07T22:20:38.880563Z","submitted_at":"2024-03-21T16:49:20Z","title":"DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video","version":2},"cited_work":{"arxiv_id":"2403.14548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14548","snapshot_observed_at":"2026-08-07T10:27:01.637889Z","title":"DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video","venue":"cs.CV","work_id":"9acee603-919a-404d-bc9f-664dceda1c9b","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.573734Z"},"links":{"cited_paper":"/paper/2403.14548","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:a6d8bba892959e0d0fc4898d62b703b37c04b0359f6b1f11006155d1742dfd7b","observation_id":"fb5b97ec-663e-4590-9d54-37f6a8ed3860","resolution":{"observed_at":"2026-08-07T10:27:01.699803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.531","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:01.047478Z","title":"Valmadre, L","venue":null,"work_id":"88f82f58-cdc2-4ce7-a879-3efcf34dadac","year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.674156Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c05c8d27e1a9d9456487baa105b6633ddc890817a3609c084ab1f900d11ae298","observation_id":"2f9870ff-2b68-403d-8327-29aecad9838a","resolution":{"observed_at":"2026-08-07T10:27:01.113263Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-07T10:26:59.796244Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.796244Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:0660a08d2eed4006af541b30066343bd84527b0afafec7d2638281e8b57ec750","observation_id":"f133875f-465d-4055-a12b-a1b2bf6f951e","resolution":{"observed_at":"2026-08-07T10:26:59.796244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.731320Z","title":null,"venue":null,"work_id":"7e21bfb0-f567-4143-b329-d93623a25150","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.872388Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c9c169f61c77388e8c3635aa187e47c39763a4147a87e61ee7621752266e9f04","observation_id":"2dc564fe-bf92-48f4-99b6-c24d41690e48","resolution":{"observed_at":"2026-08-07T10:27:03.854216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.550347Z","title":null,"venue":null,"work_id":"48d47269-3855-474b-85e1-cb6b814de028","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.957771Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:9659256ee12a5eaf396b5fa24d26e2ef75b180ee27500761db4ca2b32791d488","observation_id":"f4b16e50-ff0d-48d3-86ab-c1d5d1630fc5","resolution":{"observed_at":"2026-08-07T10:27:03.635499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.358371Z","title":null,"venue":null,"work_id":"547bf98d-1371-4a04-a651-d08acb69a8e3","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.064803Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:8ec8c1cf7460d6ce46772d5089728c022f6f409780631e601c91fdf5fd3f0097","observation_id":"66795952-0924-49bf-8abd-8f5f9b65fd93","resolution":{"observed_at":"2026-08-07T10:27:03.472517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18954","last_updated":"2023-10-29T09:55:28Z","snapshot_observed_at":"2026-07-06T16:40:04.137474Z","submitted_at":"2023-10-29T09:55:28Z","title":"Mask Propagation for Efficient Video Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18954","snapshot_observed_at":"2026-08-07T10:27:00.201356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.201356Z"},"links":{"cited_paper":"/paper/2310.18954","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:a4dfb72d5000cafc0fed2ca1b6a38605ce36de8fe19a3cc26a6ab31ebdc2e4c8","observation_id":"89638095-e7d9-4b61-9ddd-6e42162a3f61","resolution":{"observed_at":"2026-08-07T10:27:00.201356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05659","last_updated":"2021-03-18T21:08:52Z","snapshot_observed_at":"2026-08-05T08:58:30.450572Z","submitted_at":"2020-08-13T03:02:32Z","title":"What Should Not Be Contrastive in Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05659","snapshot_observed_at":"2026-08-07T10:27:00.313883Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.313883Z"},"links":{"cited_paper":"/paper/2008.05659","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:81603254dda0a0dc5964dee590e9f878a9f54931fdff70c0f453f4d39d47e4b0","observation_id":"ff2ce6b6-5e65-47c3-b5fe-22e9f8f83219","resolution":{"observed_at":"2026-08-07T10:27:00.313883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.17263","last_updated":"2021-10-14T01:44:48Z","snapshot_observed_at":"2026-07-31T00:45:46.113372Z","submitted_at":"2021-03-31T17:56:35Z","title":"Rethinking Self-supervised Correspondence Learning: A Video Frame-level Similarity Perspective","version":5},"cited_work":{"arxiv_id":"2103.17263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.17263","snapshot_observed_at":"2026-08-07T10:27:01.426515Z","title":"Rethinking Self-supervised Correspondence Learning: A Video Frame-level Similarity Perspective","venue":"cs.CV","work_id":"cc3d6965-33ec-4126-a725-892c5c7947cd","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.453266Z"},"links":{"cited_paper":"/paper/2103.17263","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:86a5fba4aa4e5cecdb601811ac6a6b04be67926b4bf6415751a784feab1c8f21","observation_id":"fff358bb-25ac-4658-9b82-c9e02b7bb5a2","resolution":{"observed_at":"2026-08-07T10:27:01.507949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02066","last_updated":"2023-04-07T01:10:17Z","snapshot_observed_at":"2026-07-06T13:17:30.429965Z","submitted_at":"2022-06-04T23:16:52Z","title":"PIDNet: A Real-time Semantic Segmentation Network Inspired by PID Controllers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02066","snapshot_observed_at":"2026-08-07T10:27:00.565630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.565630Z"},"links":{"cited_paper":"/paper/2206.02066","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:3121c0080b18c2ac695fcd728eb45428de1f4370e2f3601fc70f0c047d522f98","observation_id":"d28aa240-261e-4ce8-9022-5197386c229c","resolution":{"observed_at":"2026-08-07T10:27:00.565630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-07T10:27:00.674386Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.674386Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:2769e28bef9602c3144d6deba835d2e6c5d6e06e8f5fceb0284bb1b21ac38b0f","observation_id":"c0f9be20-457d-4a22-923c-6fe834b27fb4","resolution":{"observed_at":"2026-08-07T10:27:00.674386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13305","last_updated":"2023-12-20T03:01:33Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T03:01:33Z","title":"DVIS++: Improved Decoupled Framework for Universal Video Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13305","snapshot_observed_at":"2026-08-07T10:27:00.801887Z","title":"Zhang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.801887Z"},"links":{"cited_paper":"/paper/2312.13305","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:058e1a593148ae79f4676f6f48f5e37e443a1bc19f89a2651b368698cceb991b","observation_id":"f065b8b8-0aa2-4922-9686-68ad0db7794d","resolution":{"observed_at":"2026-08-07T10:27:00.801887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00661","last_updated":"2018-08-10T09:46:46Z","snapshot_observed_at":"2026-07-06T06:53:38.986055Z","submitted_at":"2018-08-02T04:24:36Z","title":"Adaptive Temporal Encoding Network for Video Instance-level Human Parsing","version":2},"cited_work":{"arxiv_id":"1808.00661","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.00661","snapshot_observed_at":"2026-08-07T10:27:01.242884Z","title":"Adaptive Temporal Encoding Network for Video Instance-level Human Parsing","venue":"cs.CV","work_id":"bd8ac4f6-99c5-4113-b785-289b07988e1c","year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.912867Z"},"links":{"cited_paper":"/paper/1808.00661","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7843ca30d875dd8d84bbdeb1611dcb2e8a9940232c6c717401ab8cfdcb5cd6f2","observation_id":"932e4234-7db9-49b8-819a-e7ead73a5e3c","resolution":{"observed_at":"2026-08-07T10:27:01.307432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-07T10:26:57.705213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.705213Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:3780634435734efc622014e64baa48ba22999bf3ddc5bcc91dc5ebdc06fa80f7","observation_id":"d678e2af-5d5f-4479-b05a-e88dd39b194c","resolution":{"observed_at":"2026-08-07T10:26:57.705213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:17:02.022977Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":10,"verified_fuzzy":9},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.05543."}