{"as_of":"2026-08-20T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14ac041189494dcf18d2441666762104a17810e5625fb57cec3b59e9e0e92d1f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:50:32.514966Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:49.804199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:384689072ef90ba4022b769bd665e2ab9a2a37b6ad6050719809152ad9601079","observation_id":"f9c80622-dd4a-4296-8644-c964521a19a2","resolution":{"observed_at":"2026-05-16T09:38:09.533761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2406.05615","last_updated":"2026-05-12T03:37:41Z","snapshot_observed_at":"2026-08-13T06:13:12.956934Z","submitted_at":"2024-06-09T02:36:28Z","title":"Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T00:22:35.635679Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2406.05615"},"observation_digest":"sha256:d1f4dbfec2daae621c822a9cab5f4242693cee15c4bd757f20314ae28afaafb4","observation_id":"f61f62ae-f6e4-414c-9216-2a8e3757797d","resolution":{"observed_at":"2026-05-24T00:23:39.590980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-11T15:50:32.514966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10629","last_updated":"2024-12-14T00:43:11Z","snapshot_observed_at":"2026-08-19T08:39:35.218966Z","submitted_at":"2024-12-14T00:43:11Z","title":"Rapid Reconstruction of Extremely Accelerated Liver 4D MRI via Chained Iterative Refinement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:50:32.514966Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2412.10629"},"observation_digest":"sha256:066ac50e8221f108672508fc56128959a07780049916a9d6a094487566eb1e6e","observation_id":"268ae948-2c9d-46bb-9d91-28360e4305ab","resolution":{"observed_at":"2026-08-11T15:50:32.514966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-11T11:20:27.090105Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15595","last_updated":"2024-12-20T06:39:40Z","snapshot_observed_at":"2026-08-18T15:51:29.582103Z","submitted_at":"2024-12-20T06:39:40Z","title":"Mask-RadarNet: Enhancing Transformer With Spatial-Temporal Semantic Context for Radar Object Detection in Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:20:27.090105Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2412.15595"},"observation_digest":"sha256:5a7ea9ccdd1a149aa51377f7020f701bbcc444f30f384f8fea1c22687105eca5","observation_id":"366c63c6-aa71-4bb7-a88c-1f8bda6db2b2","resolution":{"observed_at":"2026-08-11T11:20:27.090105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-10T20:17:36.366468Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08931","last_updated":"2025-01-15T16:34:20Z","snapshot_observed_at":"2026-08-19T08:11:07.759537Z","submitted_at":"2025-01-15T16:34:20Z","title":"Visual WetlandBirds Dataset: Bird Species Identification and Behavior Recognition in Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:17:36.366468Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2501.08931"},"observation_digest":"sha256:f07f1ef3b651d31135eef604a4d43bcd3a19b3c44b03117567bdf6b5f9d1a29d","observation_id":"5bee6127-0dcc-43df-a926-b519a3dd18a4","resolution":{"observed_at":"2026-08-10T20:17:36.366468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-07T05:10:59.434114Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08612","last_updated":"2025-06-10T09:21:48Z","snapshot_observed_at":"2026-08-14T13:22:45.754721Z","submitted_at":"2025-06-10T09:21:48Z","title":"Data-Efficient Challenges in Visual Inductive Priors: A Retrospective","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T05:10:59.434114Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2506.08612"},"observation_digest":"sha256:84acd46e9247a563b36b5d1e9972edb63a62fc9db2560de18fcb4d7a8963196b","observation_id":"de12811d-cc0d-4bcc-a084-55f0f3072b63","resolution":{"observed_at":"2026-08-07T05:10:59.434114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-06T22:55:23.881825Z","title":"arXiv preprint arXiv:2106.13230 (2021) 2, 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20342","last_updated":"2025-06-25T11:50:23Z","snapshot_observed_at":"2026-08-16T17:17:18.252348Z","submitted_at":"2025-06-25T11:50:23Z","title":"Feature Hallucination for Self-supervised Action Recognition","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T22:55:23.881825Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2506.20342"},"observation_digest":"sha256:b5438ca4c589a4b208ed23b6ca5bd42c45c66775a172af695763c43734dca0db","observation_id":"31bac54f-710e-42bd-9f64-fc4ae6435b56","resolution":{"observed_at":"2026-08-06T22:55:23.881825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-06T05:58:27.648814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01045","last_updated":"2025-08-01T19:52:34Z","snapshot_observed_at":"2026-08-18T01:39:24.577086Z","submitted_at":"2025-08-01T19:52:34Z","title":"Structured Spectral Graph Learning for Anomaly Classification in 3D Chest CT Scans","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:58:27.648814Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2508.01045"},"observation_digest":"sha256:44142304abef05dece01ff6278acc4490c7591e00b9afe3ad44918514e7e87d1","observation_id":"08074c3b-45e3-4666-b1fb-f80f23217d01","resolution":{"observed_at":"2026-08-06T05:58:27.648814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-05T17:29:03.792173Z","title":"Liu et al., ``Video swin transformer,'' arXiv preprint arXiv:2106.13230, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16207","last_updated":"2025-08-25T05:44:22Z","snapshot_observed_at":"2026-08-18T11:28:05.037931Z","submitted_at":"2025-08-22T08:27:35Z","title":"T-MASK: Temporal Masking for Probing Foundation Models across Camera Views in Driver Monitoring","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T17:29:03.792173Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2508.16207"},"observation_digest":"sha256:7720c865ffa4930cbefa6119161efd62ba05ade97b7161b28d726184511a4428","observation_id":"33867df1-31d6-4f57-977a-8e13d95fb8cb","resolution":{"observed_at":"2026-08-05T17:29:03.792173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2509.21261","last_updated":"2026-05-14T03:22:48Z","snapshot_observed_at":"2026-08-17T05:25:33.674518Z","submitted_at":"2025-09-25T14:54:24Z","title":"Every Subtlety Counts: Fine-grained Person Independence Micro-Action Recognition via Distributionally Robust Optimization","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:40.050017Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2509.21261"},"observation_digest":"sha256:0b763a1434c670150c0a85b04cbbf552c704059c6cd39bfe5cf406b33af76a9f","observation_id":"45a90db6-05b5-4f1c-aa47-26c4cf7f6668","resolution":{"observed_at":"2026-05-18T13:41:25.582613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-04T10:20:00.972236Z","title":"Video Swin Transformer , June 2021 c","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10779","last_updated":"2026-06-21T10:31:34Z","snapshot_observed_at":"2026-08-08T04:58:01.002307Z","submitted_at":"2025-10-12T19:49:51Z","title":"Structured Spectral Graph Representation Learning for Multi-label Abnormality Analysis from 3D CT Scans","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:00.972236Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2510.10779"},"observation_digest":"sha256:dcaa0fffb1cec72d819551376533a5a4aac8d7ebdf4a9c904be5537da5b2b4ee","observation_id":"fca90970-7504-4e69-8218-5e7a1f3c5984","resolution":{"observed_at":"2026-08-04T10:20:00.972236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2512.10248","last_updated":"2026-05-07T00:10:41Z","snapshot_observed_at":"2026-08-16T21:02:08.586221Z","submitted_at":"2025-12-11T03:12:56Z","title":"RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T23:13:02.040618Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2512.10248"},"observation_digest":"sha256:1a9b1d0bf74dc2b9982d608523d152c3e6681790da3dc3929177c6de5fcaf42f","observation_id":"dad599ad-5493-4212-86c6-1541f35a956a","resolution":{"observed_at":"2026-05-16T23:13:39.366912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2604.09326","last_updated":"2026-04-10T13:51:19Z","snapshot_observed_at":"2026-08-15T04:01:26.205856Z","submitted_at":"2026-04-10T13:51:19Z","title":"Multimodal Anomaly Detection for Human-Robot Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:22:13.877296Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2604.09326"},"observation_digest":"sha256:ec661fd2b7282cc7e8f0540dca682659a2f2883f911312ad8170f6a4cdaa5fa8","observation_id":"b7182760-3804-4eba-a166-9ffc836ea0fc","resolution":{"observed_at":"2026-05-11T06:56:03.705513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2604.11389","last_updated":"2026-04-13T12:29:16Z","snapshot_observed_at":"2026-08-16T20:44:55.771649Z","submitted_at":"2026-04-13T12:29:16Z","title":"ConvFormer3D-TAP: Phase/Uncertainty-Aware Front-End Fusion for Cine CMR View Classification Pipelines","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:56:32.221330Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2604.11389"},"observation_digest":"sha256:fbb0b0b39e96953eb1c9233830ff26452799d9581003053d4c139ec2fa313d91","observation_id":"a2f356bf-7d7a-4703-b1fe-d420fcf31f3f","resolution":{"observed_at":"2026-05-11T09:36:02.132180Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2604.16987","last_updated":"2026-08-06T06:53:47Z","snapshot_observed_at":"2026-08-16T05:45:35.337885Z","submitted_at":"2026-04-18T13:22:42Z","title":"DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T07:51:04.580617Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2604.16987"},"observation_digest":"sha256:adf3ed44c0af40c4ddf1972b348f82fa16bb28b32ccd3a924e8b761ec5fae017","observation_id":"e485d4af-f542-482a-8768-5f3a1d18db1f","resolution":{"observed_at":"2026-05-10T07:52:13.661109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.02094","last_updated":"2026-05-03T23:25:45Z","snapshot_observed_at":"2026-08-13T06:14:09.996280Z","submitted_at":"2026-05-03T23:25:45Z","title":"SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T19:23:07.258575Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.02094"},"observation_digest":"sha256:ab7ff7209f13057d9ade21d1c97b75a7489b7fd024c8c674181971c5785b6d5d","observation_id":"58128543-0302-4e1b-b32f-20cc9b8ad66a","resolution":{"observed_at":"2026-05-09T05:55:30.886907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-08-16T13:19:00.029881Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:4205e21e0745f72ac7775446f60e66bd8b864fd7ae1e9ae61f03d556638f72cc","observation_id":"4d1c6c00-887c-4f63-87b8-1ab91b108f48","resolution":{"observed_at":"2026-05-12T03:16:18.777601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:4b779b3a8d3b1013fe0d21e178f17d137d008a7790a5bedbf5dd835097f6aeaf","observation_id":"4fd0229e-93a6-4b99-b806-09946d6b93b6","resolution":{"observed_at":"2026-05-12T02:06:15.037782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.17133","last_updated":"2026-05-16T19:46:33Z","snapshot_observed_at":"2026-08-15T19:25:06.732340Z","submitted_at":"2026-05-16T19:46:33Z","title":"CAM-VFD: Cross-Attention Multimodal Video Forgery Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T15:08:25.309094Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.17133"},"observation_digest":"sha256:4bb310b873566561f68cce662e13adbc33e162cd763f556ad495ad62191cc6d9","observation_id":"6a28b164-8843-4293-bf48-29a75376b793","resolution":{"observed_at":"2026-05-20T15:13:25.065817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2605.27686","last_updated":"2026-05-26T21:03:42Z","snapshot_observed_at":"2026-08-02T04:59:17.402182Z","submitted_at":"2026-05-26T21:03:42Z","title":"Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:42.533804Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2605.27686"},"observation_digest":"sha256:5b18bd4f09f2682bfa87841bcb48558c9268e95dea0d117463eb1b595d8f54b2","observation_id":"5aaa64a0-7d81-4001-be48-c7f848a98c88","resolution":{"observed_at":"2026-06-29T18:13:48.726915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:49ea985dbb1b99f5b62d750bf2f13063fc4409f71a98777e558851ddf0b82f69","observation_id":"66797a37-6d28-4a73-99d2-a0a9d73ece4d","resolution":{"observed_at":"2026-07-02T12:46:56.768986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2606.12215","last_updated":"2026-06-10T15:29:45Z","snapshot_observed_at":"2026-07-06T23:51:13.191639Z","submitted_at":"2026-06-10T15:29:45Z","title":"MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:22.054789Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2606.12215"},"observation_digest":"sha256:b5f23ffed37bc6a507c8af516763a0f6e1aa879f401cd21074e26a313484a1c4","observation_id":"b2f6fa34-a672-4bb2-8fe8-f559dbbf406b","resolution":{"observed_at":"2026-07-03T10:58:03.528046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2606.17437","last_updated":"2026-06-16T02:37:43Z","snapshot_observed_at":"2026-08-14T08:33:24.620957Z","submitted_at":"2026-06-16T02:37:43Z","title":"Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T02:11:37.740576Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2606.17437"},"observation_digest":"sha256:5057d1da3f82a05beb9a84bdeabd56eedba8f898f18bbaf4095f9363d19613be","observation_id":"aefef589-a3d6-4877-a7fd-db1cbd7fc10e","resolution":{"observed_at":"2026-07-03T19:08:49.805619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2606.20693","last_updated":"2026-06-15T05:11:45Z","snapshot_observed_at":"2026-08-15T10:27:06.194567Z","submitted_at":"2026-06-15T05:11:45Z","title":"Spatio-Temporal Wildfire Spread Prediction in Canada using a Video Swin-Hybrid-U-Net and Satellite Imagery","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T03:59:57.906013Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2606.20693"},"observation_digest":"sha256:32e1139b36a00ceaab92fb3a8233e70535fd77b0fc6f36f07fc85010d786acce","observation_id":"c0767247-40c6-4882-a33a-79aed324b7e0","resolution":{"observed_at":"2026-07-03T17:38:43.730098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-08-02T04:39:23.642262Z","title":"arXiv:2106.13230 [cs.CV] https://arxiv.org/abs/ 2106.13230","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16322","last_updated":"2026-07-15T09:37:58Z","snapshot_observed_at":"2026-08-14T19:19:51.691582Z","submitted_at":"2026-07-15T09:37:58Z","title":"GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:23.642262Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2607.16322"},"observation_digest":"sha256:e75ff76011a0fd72fc85c26525ceedcac4c815d82afed7c5c571ba9eb4c6ad3c","observation_id":"c8c7c708-419f-498a-94fa-83116a766446","resolution":{"observed_at":"2026-08-02T04:39:23.642262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.13230/citation-record","integrity":"/paper/2106.13230/integrity","json":"/paper/2106.13230/citation-record.json","paper":"/paper/2106.13230"},"outbound":[],"paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:27:26.316374Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2106.13230."}