{"as_of":"2026-08-08T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5148d0ba2f3430a7cac87997f9bc079a4b0dc41c514af26d8c96adedbd03566","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:51:56.884183Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12585/citation-record","integrity":"/paper/2506.12585/integrity","json":"/paper/2506.12585/citation-record.json","paper":"/paper/2506.12585"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-07T00:51:56.633975Z","title":"Youtube-8m: A large- scale video classification benchmark","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.633975Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:479b62b5d5bcca93dd360074b7a4b4a33d3d496227e87b030378ee3733f5f375","observation_id":"b67e59df-72e3-4759-8e5a-2bb81e2eef98","resolution":{"observed_at":"2026-08-07T00:51:56.633975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.520522Z","title":"Timesformer-base-finetuned-ssv2","venue":null,"work_id":"08c00ad0-5af4-4de9-81d0-74aabca576c1","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.642321Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b6165dfa94b0f0302c109ee71d8ea95125a54e40d9065aed04e1cdaf2d8eba68","observation_id":"8ab1f47e-37e1-492d-ba82-f1c039c19797","resolution":{"observed_at":"2026-08-07T00:51:57.525211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.648106Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.648106Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:f1363893d7454f488a4d55c9fa464082cd44572c19807a514aa22ea3ae3106c0","observation_id":"658d9a26-9c3b-4d8d-aab3-e2817319650d","resolution":{"observed_at":"2026-08-07T00:51:56.648106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00075","last_updated":"2018-10-31T19:24:20Z","snapshot_observed_at":"2026-07-06T07:11:52.518341Z","submitted_at":"2018-10-31T19:24:20Z","title":"The UEA multivariate time series classification archive, 2018","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00075","snapshot_observed_at":"2026-08-07T00:51:56.654307Z","title":"The uea multivariate time series classification archive, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.654307Z"},"links":{"cited_paper":"/paper/1811.00075","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d3b5ab4cb41703b8b1c1fcaa58b1c53356bef1b06a9664fc2b07efbdacd5173e","observation_id":"0e6c9a0d-4b2b-4063-b9ca-347ec6f49e00","resolution":{"observed_at":"2026-08-07T00:51:56.654307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.494760Z","title":"Using dynamic time warping to find patterns in time series","venue":null,"work_id":"ce6da1de-7ac8-4645-9940-864ff583c9e5","year":1994},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.662898Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:722ed16dce1da8bdadd3ecaaca38d97b18febae1eb37f9ba87ab41e9be8832e8","observation_id":"5bbfc546-cf26-442b-a620-80a9224747a0","resolution":{"observed_at":"2026-08-07T00:51:57.499531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.478903Z","title":"Is space-time attention all you need for video understanding? In International Conference on Machine Learning , pages 813–824","venue":null,"work_id":"8e62bf43-3b77-457c-a9eb-6e6ba1aa7752","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.669434Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:2de7398389090889a0b6a665647a8f38c706cd45777847d7ee69f2949968691c","observation_id":"1d43921f-e6c8-4bf0-80f9-0808086775e4","resolution":{"observed_at":"2026-08-07T00:51:57.484306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.463649Z","title":"Dtwnet: a dynamic time warping network","venue":null,"work_id":"73043a81-b4b0-4ffa-ab4d-d3d41812d5c8","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.675610Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:c243003071125109deeb80d005fb2eaa6203af7aafb295dbbeec76a7cf2b7067","observation_id":"cf12174a-9605-4cc6-94ec-25092be3717a","resolution":{"observed_at":"2026-08-07T00:51:57.468495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.448639Z","title":"Few-shot video classification via tem- poral alignment","venue":null,"work_id":"cadab136-3728-405f-889c-5f59faa3acf8","year":2020},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.683460Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:650d1e5c8528cb0dc802559b8b5132adf6d719ca0453b50f63774906c68541c9","observation_id":"b4090e4c-e43c-4145-bfb2-a4b89ad4c28f","resolution":{"observed_at":"2026-08-07T00:51:57.453503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.432546Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"b2ba7690-06bf-4c63-883d-1a229d6598c7","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.689715Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:1a05ee4e671a7d82eb8bb40580b73b6629edd3364cd015f692eb7730559013dc","observation_id":"09578d25-841b-4bdb-bc52-a50e17681f84","resolution":{"observed_at":"2026-08-07T00:51:57.437285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.416806Z","title":"D3tw: Discriminative differentiable dy- namic time warping for weakly supervised action alignment and segmentation","venue":null,"work_id":"fa64e6de-5307-4cd0-81a9-255e953534ac","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.696692Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b83766de7b365d68378cc94d12eb2e1667fb635e112c8b90d02e80b30f994c5b","observation_id":"315ad924-60b3-4429-8890-1adac7358998","resolution":{"observed_at":"2026-08-07T00:51:57.421567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.399607Z","title":"Soft-dtw: a differen- tiable loss function for time-series","venue":null,"work_id":"0b11c68c-65f3-49dd-84b4-a25e1ddf3914","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.702587Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:cf5697453b901dc2c96a1aad5c14e3a8ba8994bf8ab577cea237190f048a1cee","observation_id":"72fb712a-6387-4227-928a-1b4aa814a023","resolution":{"observed_at":"2026-08-07T00:51:57.405107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:51:56.708585Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.708585Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:3973349a55473aa54b0591892ed3573ef849e0d34b871734492a24478a039a3f","observation_id":"49b76c07-5636-4dec-89ea-cc453d97ef29","resolution":{"observed_at":"2026-08-07T00:51:56.708585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.382993Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"06435b6b-885a-46bc-833a-28f561871a49","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.714671Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:27b6318247629c8ef7fb7a6f54f1b8464676147bf9589623ac82fee2263384b4","observation_id":"459a09dc-828e-4b8a-b759-e4ff64da2bcb","resolution":{"observed_at":"2026-08-07T00:51:57.388333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.367058Z","title":"Fine- grained temporal contrastive learning for weakly-supervised temporal action localization","venue":null,"work_id":"9583fbc7-dcba-4cb9-8037-dbb80e9fc131","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.720485Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:09a28ee0e7e18b5124ea79cdfbe6d4ac076b47aa6620d6b7ff1c4ef83582bf60","observation_id":"7f00da72-1183-46ff-a8af-06f48485d2fe","resolution":{"observed_at":"2026-08-07T00:51:57.372011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.351000Z","title":"Video action transformer network","venue":null,"work_id":"93c98a91-f694-4996-bc68-bdd91e229840","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.727998Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:a2e0c5f73fc2abf4574f190b75213fef33eb25d8ced43a7c3e170e2821acefeb","observation_id":"bfe652ce-9907-4a39-815b-03c21ce5086d","resolution":{"observed_at":"2026-08-07T00:51:57.355791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.335363Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"6ee458bb-873e-411d-821e-ba3c0232940f","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.734194Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:6bfa197d50c307927738114b61836798a55e261f2626b21b059e937dcbd12b04","observation_id":"5b31ee90-1947-4b84-ad02-bb3848c92ffa","resolution":{"observed_at":"2026-08-07T00:51:57.340875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.320112Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":"5cea6be5-c054-40d3-8c7c-1942bf117674","year":2014},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.740138Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:4c8bf471038fd869cb5f403b041569f87c637331803ec15e7b2601cf81884d86","observation_id":"d22e2b74-cc59-435e-b28f-a9c623386500","resolution":{"observed_at":"2026-08-07T00:51:57.325267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T10:06:58.769155Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:51:56.746645Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.746645Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:85090efc41d9cb57d997a00610eb9fe5e7a890b104d121bd84ffa5fee785b521","observation_id":"9f767076-8961-46d2-b541-d5fefcb44829","resolution":{"observed_at":"2026-08-07T00:51:56.746645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.753566Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.753566Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:828aeed823b690f352e95a657b2c750f3703f88cbd2afcdb7e31145a525341e9","observation_id":"10b678ad-36a8-44d2-9eda-b472ec2b4779","resolution":{"observed_at":"2026-08-07T00:51:56.753566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.293989Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"4bdff457-f1f5-4244-8a78-856b74b36b0c","year":2011},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.761485Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d05212ea46564a8d9ab074cc0ff49c2d45d24d866d18ca30cbd4f3d5e982b26e","observation_id":"aca566b0-fae4-45de-9ee6-402a446ed581","resolution":{"observed_at":"2026-08-07T00:51:57.299267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.278462Z","title":"Tam: Temporal adaptive module for video recog- nition","venue":null,"work_id":"ab986574-e776-4dae-83d2-d9e81b0d8ed1","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.767773Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:ecc845a6a7f5919cbca0fbd52a9782c72df2c0c81940acf840e06f391b2cf33e","observation_id":"b22a03c0-d157-4d0d-a430-b76faa09ebf0","resolution":{"observed_at":"2026-08-07T00:51:57.283560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.263122Z","title":"Action recognition on something-something v2 leaderboard","venue":null,"work_id":"720f27ee-cfdf-4fe5-b8fd-aa4c0c048cb8","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.773604Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:acf7392ff860696186842d5e170f1c3b4953c599999f87f9f5974d86234c04b9","observation_id":"7b9f8c0d-00dc-4b12-90ab-d2b9395b7587","resolution":{"observed_at":"2026-08-07T00:51:57.267961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.230231Z","title":"A global averaging method for dynamic time warping, with ap- plications to clustering","venue":null,"work_id":"5fb5dd35-a7ee-4ab3-8404-dfa462d7f517","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.786601Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b37f481965e5e3b89dde95307c212a5cfa69a124c384a47daec58fde12f014be","observation_id":"b2429d20-ce5a-4c9a-a0f7-4a670b37a1d8","resolution":{"observed_at":"2026-08-07T00:51:57.235229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.214919Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"16e11ca1-fcea-42e8-9a50-2454df59bbb7","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.793063Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:2d88cc3c2305032d704dce940d8c43104904076be7f8e406aa890e83f26a6d80","observation_id":"7b01e21c-c369-4531-94f8-37af1feec1cf","resolution":{"observed_at":"2026-08-07T00:51:57.220040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.199873Z","title":"Vivit-b-16x2-kinetics400","venue":null,"work_id":"3b38002b-2d9b-4ebb-8605-8a632b4f0448","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.799549Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:5facf5139f4cfe41aa0ec11544d73df30834d6b0e3b4b1d720a8c5bec40d5268","observation_id":"d893f334-bfab-4f78-a694-2d4300b22767","resolution":{"observed_at":"2026-08-07T00:51:57.204661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.184939Z","title":"Dynamic time warping algorithm review","venue":null,"work_id":"0fec7af3-1d52-49ec-a720-61278fa76ca1","year":2008},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.805951Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:398a8a7c3c912047495a12119ee4078579b1ff634a071bca037772a1c7b1e7c7","observation_id":"1d9f18c2-6219-4efa-8109-9b06d1675cbd","resolution":{"observed_at":"2026-08-07T00:51:57.189675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.169304Z","title":"The move-split-merge metric for time series","venue":null,"work_id":"c5b0daef-4a0c-4bf7-8396-3cc361740606","year":2012},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.813505Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:0f47645be959b949d93489561b3327aac34184848d83919ecb011e7fd2924787","observation_id":"d83b47c6-d347-44ad-bc5b-bf406b750fb4","resolution":{"observed_at":"2026-08-07T00:51:57.173908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.820397Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.820397Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:af622415748056760112156c64021f2687c277ad967b0e9f2229c19cd4e237f0","observation_id":"ae3fccc3-ab4b-497c-936e-f4bdbf6f40cc","resolution":{"observed_at":"2026-08-07T00:51:56.820397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.143287Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"6592eb58-0125-44a9-a40d-eb17bdfb7304","year":2015},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.826935Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:81721a989397f30a16400e0e46e855daaf9389b9bc5fbf7b1da28469ff46a5b2","observation_id":"4ca14107-601d-42f1-8128-b6e559cacf50","resolution":{"observed_at":"2026-08-07T00:51:57.148604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.127068Z","title":"Implicit temporal modeling with learn- able alignment for video recognition","venue":null,"work_id":"5c583f08-820b-4e70-b6f2-ef45de9ee4eb","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.833801Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:1806b373beec9fdf094e5f18d9700187cda5fba20b184227fdb23095495a3c24","observation_id":"a39310a2-bc76-415a-9f7a-b977ed6debc5","resolution":{"observed_at":"2026-08-07T00:51:57.132257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.110600Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"3abf8bc8-2a94-4127-9634-106a480614b8","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.839546Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:493e8138aaea3826c3194c6058aa4d027ee4be5687c6eb31651d72b84b317df0","observation_id":"9a368ee8-8e1b-4778-a037-9852857ffb9b","resolution":{"observed_at":"2026-08-07T00:51:57.116076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.094884Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":"8c336e7b-dc7b-4035-85c2-f5cfbe7cdd33","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.845472Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:38925f34b643ea33bf8778548bccecb147dfd0f54c0bf266ae207f8e9db8e7c9","observation_id":"5838d60d-65ef-43e8-9612-0def7432d396","resolution":{"observed_at":"2026-08-07T00:51:57.099790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T00:51:56.851307Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.851307Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:67e30f9c6fd56ebce5b2072fb08d1c4b1e8075db34e8b18b14e4f4e4c05c1d98","observation_id":"30471e61-9c6b-4718-a4bb-197fbf6e0fd0","resolution":{"observed_at":"2026-08-07T00:51:56.851307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.078543Z","title":"What can simple arithmetic oper- ations do for temporal modeling? In Proceedings of the IEEE/CVF International Conference on Computer Vision , pages 13712–13722, 2023","venue":null,"work_id":"48aa57cd-21ff-4944-8599-d1d19553d2cb","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.857324Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d9f86968807b5be612e933ebf6a3a784c2a7e95c944d825210ca948d1afb0743","observation_id":"cc167c16-f907-46f5-bfd2-fbe96b8520ef","resolution":{"observed_at":"2026-08-07T00:51:57.083923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.063911Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"20758cc5-bcdd-4a55-baa1-cdef6c52999d","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.863125Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:32479b9aefe1720c9afb84706b18e23da50cab72c1aad883655264bb017f31b2","observation_id":"f5639af5-dde6-4f43-9e8d-c87a9a7145d7","resolution":{"observed_at":"2026-08-07T00:51:57.068465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.049149Z","title":"Scaling vision transformers","venue":null,"work_id":"d1df8986-f98e-4d13-aae2-44fd03dda964","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.872058Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:c4c2d69c513e807adab69ef027ffc67cb4dcad36d0868dcd6de5fe92043ddf10","observation_id":"253a879a-021b-469c-92db-e516a989b60c","resolution":{"observed_at":"2026-08-07T00:51:57.053463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.031452Z","title":"We now describe our choice of the temporal sliding win- dow widths and strides","venue":null,"work_id":"0d721786-ef03-4bde-bfb2-73f2b1b68f87","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.877590Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:1a213d80589a019d867292827e2f614b474e7d34420d7a1ad54adad9fa7a3e18","observation_id":"a61480f8-53da-4da3-a8c4-5ff66ee9bd86","resolution":{"observed_at":"2026-08-07T00:51:57.038230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.013130Z","title":null,"venue":null,"work_id":"47433fc2-d555-4951-a94d-a96cc75b04b1","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.884183Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:890c6f04e6fb356cb1ae1a8b2d69d59b40ce6beb4e549302c2968122f0e0c8f4","observation_id":"edd693eb-2acf-46f2-9be7-970f10af564f","resolution":{"observed_at":"2026-08-07T00:51:57.019889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.246646Z","title":null,"venue":null,"work_id":"9e022908-a788-4a27-95a0-15a84f9f702c","year":2024},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.781033Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:39719acb167fcbac6191d6ee46c507b27d71de37d3431aa8522e837f5dc0ba75","observation_id":"05b6330b-9b7a-4205-9ffd-8f9f28183805","resolution":{"observed_at":"2026-08-07T00:51:57.251878Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:43:16.069936Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":9,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.12585."}