{"as_of":"2026-08-12T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d716e5c73d67eeb2d678b21ec38a74a46786bcf2271997845cc1e5cb77bbcc0","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:48:55.359897Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20002/citation-record","integrity":"/paper/2412.20002/integrity","json":"/paper/2412.20002/citation-record.json","paper":"/paper/2412.20002"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.037170Z","title":"Adaptive and background- aware vision transformer for real-time uav tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.037170Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:682863fab0d0d5975cd739f0f47c5e4ff44431f89cc19fdae28f0d47c03331f6","observation_id":"b65fc62f-b991-4857-9b87-c962d44cd3a7","resolution":{"observed_at":"2026-08-10T23:48:55.037170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.042015Z","title":"Autotrack: Towards high-performance visual tracking for uav with automatic spatio-temporal regularization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.042015Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:b265c2f21de8870159ef0ba6572879ce177c78995161cca278a369321a2fe100","observation_id":"fa945983-f6cb-4fec-a7c2-4e430722b313","resolution":{"observed_at":"2026-08-10T23:48:55.042015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.045836Z","title":"Hift: Hierarchical feature transformer for aerial tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.045836Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:621a6d9bacafab478edd880b98a499ad12242d30c695fa89a0717df716617f44","observation_id":"f5dffc18-ce92-44e6-9c1a-3d2a1250091a","resolution":{"observed_at":"2026-08-10T23:48:55.045836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05383","last_updated":"2025-08-21T11:44:52Z","snapshot_observed_at":"2026-08-05T08:41:00.787688Z","submitted_at":"2024-07-07T14:10:04Z","title":"Learning Motion Blur Robust Vision Transformers for Real-Time UAV Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05383","snapshot_observed_at":"2026-08-10T23:48:55.049155Z","title":"Learning motion blur robust vision transformers with dynamic early exit for real- time uav tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.049155Z"},"links":{"cited_paper":"/paper/2407.05383","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:e796c2c2f4e95d5caa024766cdd9e12048e5a454f7675392c8c4eba07528b1b1","observation_id":"bfa3d96e-1e83-45b9-80fc-3e1ea255e658","resolution":{"observed_at":"2026-08-10T23:48:55.049155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.053147Z","title":"High-speed tracking with kernelized correlation filters,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.053147Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:847a885a1d713219e16d8e73965f8742ba98ca4c6c61525996643c9695e18e97","observation_id":"141ef450-e0e4-4016-b7de-108b425d081e","resolution":{"observed_at":"2026-08-10T23:48:55.053147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.056749Z","title":"Learning spatially regularized correlation filters for visual tracking,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.056749Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:cf951d44f57b0fcc01a0456767b09c31b6cad48d89e01b29ec88e4a336a9f05d","observation_id":"f4f279e3-afec-4649-b1ab-542744db9eb3","resolution":{"observed_at":"2026-08-10T23:48:55.056749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.060333Z","title":"Learning aberrance repressed correlation filters for real-time uav tracking,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.060333Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:79fcf8453f61a6b708a6cffc58090434b0bf26251414783a24977e2f85e06cb2","observation_id":"0fded48b-ba14-42ca-8ba5-166cfdd7cafc","resolution":{"observed_at":"2026-08-10T23:48:55.060333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.063250Z","title":"Learning temporary block-based bidirectional incongruity-aware correlation filters for efficient uav object tracking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.063250Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:878b7ab79a814962baeb420aeb073e9f1d9b6328e6263a0fc1f7c62a35d1e224","observation_id":"94f750ef-1b3c-4d50-9e08-a8ec6317faad","resolution":{"observed_at":"2026-08-10T23:48:55.063250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.066505Z","title":"Learning background- aware correlation filters for visual tracking,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.066505Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:e9528be0126afc0d43e0292247da21ac1646bb0adbda92fa5b83caed2d054419","observation_id":"d393b1d0-964c-428e-9b5e-7673b1a2132f","resolution":{"observed_at":"2026-08-10T23:48:55.066505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.069597Z","title":"Visual tracking via adaptive spatially-regularized correlation filters,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.069597Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:725534a4379f1d8b745e48e789c653678d344fa2766582e90a9a10fe96f25c4f","observation_id":"a4bceab8-ff36-4e39-aaee-2fbe9d364e64","resolution":{"observed_at":"2026-08-10T23:48:55.069597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.072914Z","title":"Fully-convolutional siamese networks for object tracking,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.072914Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:7760eea56262eebc75eab4b7861e67bc018dfe36d2d6525c9b7e54554e53587c","observation_id":"d27974a6-95d4-4d0b-8131-ed680fc81c8b","resolution":{"observed_at":"2026-08-10T23:48:55.072914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.076110Z","title":"High performance visual tracking with siamese region proposal network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.076110Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:ff1dfee06190a45a5a408c65264149584614d395f530d7cc4424ffca6b19b4e6","observation_id":"5c8be346-a451-4ad0-aa73-bdd32dd90c56","resolution":{"observed_at":"2026-08-10T23:48:55.076110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.079104Z","title":"Siamese box adaptive network for visual tracking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.079104Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:eb9b44ab019c903b904e76a47be5ad07bc0c3d88e6c476e2f15e74cccfb0b70c","observation_id":"8c550b98-d907-4e21-ac1d-10d0c8ea45c9","resolution":{"observed_at":"2026-08-10T23:48:55.079104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.082175Z","title":"Tctrack: Temporal contexts for aerial tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.082175Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:92ee37aee19e29cc884b850d6911297a561e7b92cfcb19145049d27f9f63c2e8","observation_id":"99f60a8f-fd4a-4910-bef3-35142c7081f0","resolution":{"observed_at":"2026-08-10T23:48:55.082175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.085278Z","title":"Bactrack: Building appearance collection for aerial tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.085278Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:8c9babb33f6c9bacc5c00ee4afd1a20d3e1901ce0d03ddeedc37ae1d344527aa","observation_id":"e57b6c5e-92d4-44e6-9ab3-6bff4c0a2cbe","resolution":{"observed_at":"2026-08-10T23:48:55.085278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.088537Z","title":"Multi-step temporal modeling for uav tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.088537Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:17bae4b7bcda8e490eb158aa60561dc67889e98882f5e0241a9fcf7908599156","observation_id":"73ce6ef3-5855-4f8b-a091-3914728ac721","resolution":{"observed_at":"2026-08-10T23:48:55.088537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.091811Z","title":"Vit spatio-temporal feature fusion for aerial object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.091811Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:7d40831c2d9b14c520559b1b0a4a589d744cfc8b597e8beeddfa9ac69077f6cf","observation_id":"74c9f558-12d6-4629-9a12-80e06fec6f30","resolution":{"observed_at":"2026-08-10T23:48:55.091811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.094914Z","title":"Learning spatial-frequency transformer for visual object tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.094914Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:2c270ad6689291e2a66f0d6a6086b7e8bfc4ae7f610fed8af92363893c512602","observation_id":"f1c52db9-30fe-4251-8b07-ef78cab11e86","resolution":{"observed_at":"2026-08-10T23:48:55.094914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.097927Z","title":"Object tracking via spatial-temporal memory network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.097927Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:00db772f9ef7648a81859b3e8677b6f8769d8b050da765aa96d48e10804e5391","observation_id":"7f845f0a-2845-4ecd-9f55-9699500c67a3","resolution":{"observed_at":"2026-08-10T23:48:55.097927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.101079Z","title":"Target-aware tracking with spatial-temporal context attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.101079Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:5d676f27e76303bb2d41a9ad5640adab5fa65603cac28ea4b670662caacff027","observation_id":"2f4b2ccb-2a79-4ecf-935c-b743388cd71e","resolution":{"observed_at":"2026-08-10T23:48:55.101079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.104364Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.104364Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:518329a8bb13ad8d81fe08ee5b89e6d74165a975bc2f373ad6a0de26f426a4fa","observation_id":"afb6fb70-a995-4deb-830c-68da3fe9efb2","resolution":{"observed_at":"2026-08-10T23:48:55.104364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.107447Z","title":"Backbone is all your need: A simplified architecture for visual object tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.107447Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:ce3b2e3e2f969430f5633b463231d19ba582584023ddaf71141a174e0c3c40f7","observation_id":"4fb4651e-683b-4d2c-ac73-d8f2a95652dc","resolution":{"observed_at":"2026-08-10T23:48:55.107447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.110596Z","title":"Mixformer: End-to-end tracking with iterative mixed attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.110596Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:8788e38ca8db266ac3d41d80f4e72ce6080a406487407ffca36aaeffcf8c219f","observation_id":"228f4268-81b8-40cc-8096-d31419fb3322","resolution":{"observed_at":"2026-08-10T23:48:55.110596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.113748Z","title":"Dropmae: Masked autoencoders with spatial-attention dropout for tracking tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.113748Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:9d4ae4fe5451b0746eee85c332a006cb714a3a8b5e645978a3624fd50faf6329","observation_id":"23bb9700-fceb-490a-9a1b-fb2b51264732","resolution":{"observed_at":"2026-08-10T23:48:55.113748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.117090Z","title":"Zoomtrack: target-aware non-uniform resizing for efficient visual tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.117090Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:8a13bfcbcb38642b290239d1847667a3da6f96f39fe6f0e2d9ae4fbe6d1c40f5","observation_id":"25d5fb72-83a7-4aec-a2b8-6441b4a0605f","resolution":{"observed_at":"2026-08-10T23:48:55.117090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.120168Z","title":"Autoregressive queries for adaptive tracking with spatio-temporal transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.120168Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:914d6e4aac88914e40599f54720b41002930a0127b22f927486aeffd6866a2b5","observation_id":"49ca28a9-abdc-4966-bd58-eac117bbc8f3","resolution":{"observed_at":"2026-08-10T23:48:55.120168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.123528Z","title":"Explicit visual prompts for visual object tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.123528Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:ed2bcb324d3b367760c4c5a15e0e127ce2542f96472bfa6c14d4ab750b7a8014","observation_id":"52753068-d3b8-4ed0-a96c-9b84e4e589e8","resolution":{"observed_at":"2026-08-10T23:48:55.123528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.126893Z","title":"Hiptrack: Visual tracking with historical prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.126893Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:850b6bd4d1e909c54dd0969bcd0fa65e5fc6e000d5f843a76d44eac803c3f2a8","observation_id":"d3d5250b-9bf7-40be-8b21-91cf310e8335","resolution":{"observed_at":"2026-08-10T23:48:55.126893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.130089Z","title":"Autoregressive visual tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.130089Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:04feb0708170615d9a25426126e30820dba20e073f295e34788c863561991155","observation_id":"72da32e8-eb31-47c0-b032-2e22d7f318b9","resolution":{"observed_at":"2026-08-10T23:48:55.130089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.133485Z","title":"Exploring lightweight hierarchical vision transformers for efficient visual track- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.133485Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:91cc32f2e730d5bc6698f79034b6c145649cd9c14939644f482ffcbaee337a15","observation_id":"ef44aead-1604-4a85-a449-33bf41fdea65","resolution":{"observed_at":"2026-08-10T23:48:55.133485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.136847Z","title":"Learning adaptive and view-invariant vision transformer for real-time uav tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.136847Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:c057c0e34d4bc990c256e6a00f2026d6f188bf70782b42c5e5b1e776145919c9","observation_id":"eb193043-0c4d-4f78-a943-326c0b68c3da","resolution":{"observed_at":"2026-08-10T23:48:55.136847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.139792Z","title":"The mutual information: detecting and evaluating dependencies between variables,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.139792Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:3a95f4e374c49d726b9ec14c99f775399449f92cdc3810b616ba918257201b11","observation_id":"21c9fac6-cd50-4fa1-ab2b-2df3c8a5f4d4","resolution":{"observed_at":"2026-08-10T23:48:55.139792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.142983Z","title":"Temporal feature alignment and mutual information maximization for video-based human pose estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.142983Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:f00af0e9138bc7ab60ce5911e5283776400847a2d07ab6e8048b51c4d9e76b4e","observation_id":"939c65fd-b1da-4e3c-b7bd-283ee7c7dffe","resolution":{"observed_at":"2026-08-10T23:48:55.142983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.146016Z","title":"Learning deep generative clustering via mutual information maximization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.146016Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:2f4f0eac3dd5e9649d4ca4ecabda05ba111409cd5affcbc0c9fab163ca79e99c","observation_id":"0f35f559-9de9-4867-9663-ff467bceb137","resolution":{"observed_at":"2026-08-10T23:48:55.146016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.149634Z","title":"Learning deep representations by mutual informa- tion estimation and maximization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.149634Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:62a8f72dbe1c395c6bff857f36456e2718274a487c611ae4303949716f49a8b4","observation_id":"688c2187-35d5-44b4-a78a-344cfea2d64c","resolution":{"observed_at":"2026-08-10T23:48:55.149634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.152903Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.152903Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:78453d76c1a43d39b1e8bb4c89d923376d911ab6ee717e8d84f09e8625554cba","observation_id":"1f949eab-d47d-469b-beb2-f12115032da3","resolution":{"observed_at":"2026-08-10T23:48:55.152903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.156095Z","title":"Knowledge distillation and student-teacher learning for visual intelligence: A review and new outlooks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.156095Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:c1abc62a3d80a91a5198b144fb487d740f95b20a3d6b985ff279dfcd9d2fe8be","observation_id":"006d389b-4c5e-4d7d-adeb-28658aaced69","resolution":{"observed_at":"2026-08-10T23:48:55.156095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.159265Z","title":"Mtkd: Multi-teacher knowledge distilla- tion for image super-resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.159265Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:5289797be220758203106c127423587823df7b3c918f577b5880b67b3981e173","observation_id":"b75cb5f6-fcc0-4501-ab12-377a87a8a582","resolution":{"observed_at":"2026-08-10T23:48:55.159265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.162545Z","title":"Class incremental learning with multi- teacher distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.162545Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:02964d7d054951bd78385ecb38fa6143594883a4e057124c87d5cac6a97008c5","observation_id":"33073735-9bb0-4abe-a699-315234666d19","resolution":{"observed_at":"2026-08-10T23:48:55.162545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.165770Z","title":"Let all be whitened: Multi-teacher distillation for efficient visual retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.165770Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:4eaa46dfc41474709f0b868f75dd72dc3cdc2f1f82135c97f2e0bcc2dba92526","observation_id":"e3ec11e0-01f0-45dc-8fae-70705fc94075","resolution":{"observed_at":"2026-08-10T23:48:55.165770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T23:48:55.169032Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.169032Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:be398e0499ac7b6e8f73118e41d062e1583e7228aa0b0a8160b5f7dc5fde0f22","observation_id":"e1c58593-161f-4c11-8192-0009776098ef","resolution":{"observed_at":"2026-08-10T23:48:55.169032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.240419Z","title":"Webuav-3m: A benchmark for unveiling the power of million-scale deep uav tracking,","venue":null,"work_id":"45857dba-e5b3-4251-bf58-e7c9ac7aa469","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.172509Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:bab899cf52aed28b2a86ba0129c532999c6a071c43ba5cbdac4d318526f3655a","observation_id":"db159093-776b-4444-8452-d8636d78a4e0","resolution":{"observed_at":"2026-08-10T23:48:56.243937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.230362Z","title":"Onboard real-time aerial tracking with efficient siamese anchor proposal network,","venue":null,"work_id":"f8432d25-15a5-4852-8aa0-8595c6525732","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.175985Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:5b9a259a9abf71eb2df19b0035efc81a1bb3c536a09d72e3d3a6db3a35ae1f37","observation_id":"70a74efc-0564-49db-be83-aebd083fad4c","resolution":{"observed_at":"2026-08-10T23:48:56.234141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.220194Z","title":"A benchmark and simulator for uav tracking,","venue":null,"work_id":"1d2ee515-9779-4f62-ac7b-b12c76b25e05","year":2016},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.178978Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:385fe9557e9b2baa366851ceb2bf124606d3237a518dd8c53de0305bf21612ba","observation_id":"5e12b87a-0799-4d97-8841-93eaf814aac8","resolution":{"observed_at":"2026-08-10T23:48:56.223224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.210783Z","title":"Learning residue-aware correlation filters and refining scale estimates with the grabcut for real-time uav tracking,","venue":null,"work_id":"ea08c175-482c-46e2-8ede-8e075e95f1b5","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.182492Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:78ec4656904cee990ced497dd68a6c8c82c3ff9b47795536af9b2ecb06e68095","observation_id":"48fc0796-5940-4800-94ac-9dffa18e24b7","resolution":{"observed_at":"2026-08-10T23:48:56.213914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.200521Z","title":"Siamese anchor proposal network for high- speed aerial tracking,","venue":null,"work_id":"34fad2a8-3805-4a00-a749-5e5d153e97d5","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.185585Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:d3f15177756cf50f397672e23abb19fb943f951328d7e3be0b6e120d73b14c99","observation_id":"a3614c91-df70-48e0-a549-8eb167c9982d","resolution":{"observed_at":"2026-08-10T23:48:56.204087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.189993Z","title":"Rank-based filter pruning for real-time uav tracking,","venue":null,"work_id":"de504806-6ed4-4b70-a263-9789a090c2c9","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.188726Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:b2da9ac556fad9de30bc0218cfaaa4d2f5c31528c729463de06b95bb3fd345dc","observation_id":"2e0e1d8e-d483-490a-820b-8431b0ce5eb2","resolution":{"observed_at":"2026-08-10T23:48:56.193519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.178606Z","title":"Learning tracking representations via dual-branch fully transformer networks,","venue":null,"work_id":"5b490b51-6ad0-4ffc-aff7-d0b6f187be7c","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.192018Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:182353f870ef7a383ec19db4f978e59dd74be774f7c61718d8998dfd1c149672","observation_id":"a660bfa2-4585-4936-b733-296d832df90c","resolution":{"observed_at":"2026-08-10T23:48:56.183022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.169594Z","title":"Correlation-aware deep tracking,","venue":null,"work_id":"fa882332-4b1a-41a2-9aa3-417e5cbf0bf0","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.195109Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:cf52671ec53585c6f1212f3640edb7ce93a2ec2ac34b17e4dc8196424408c61f","observation_id":"5ecacc71-6a80-46df-a061-2b2ef1d4eb2f","resolution":{"observed_at":"2026-08-10T23:48:56.173012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.159139Z","title":"Learning target-aware vision transformers for real-time uav tracking,","venue":null,"work_id":"35ee6aeb-a319-4699-a8ef-7ecf630656cf","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.198223Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:7226d9b637f96113d3ea4c6f399a227a0adf8e448798987c5f1008182ad3e034","observation_id":"5c2cb5dc-699c-431b-b069-79aff1a5b3d9","resolution":{"observed_at":"2026-08-10T23:48:56.163196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.149416Z","title":"Efficient template distinction modeling tracker with temporal contexts for aerial tracking,","venue":null,"work_id":"95b76d42-7e06-43d8-ab11-a0c0fc46615b","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.201677Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:0264078a6e070de098f1c52da1237fc06066778d08abe717bb52d72a8493e992","observation_id":"6ce55a2c-cd38-4688-9b63-0a764fd679aa","resolution":{"observed_at":"2026-08-10T23:48:56.152802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T23:48:55.204978Z","title":"Linformer: Self-attention with linear complexity,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.204978Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:fafd55fa6bbb30d4845b49a7e367b998387ff25ff3ecd46311d0abc0b37561d5","observation_id":"3b08af9f-7197-4967-8ffa-28add4af5ea3","resolution":{"observed_at":"2026-08-10T23:48:55.204978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.139467Z","title":"Minivit: Compressing vision transform- ers with weight multiplexing,","venue":null,"work_id":"4c4af57a-d266-40ad-a998-08ba8864cee6","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.208466Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:ffc8a5a0040a39726606b6923fbf34840d1ece29a0d5bf708eeeef8c0240046d","observation_id":"a37356a1-cd27-4146-ba8c-d8abb60f4a82","resolution":{"observed_at":"2026-08-10T23:48:56.142614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.128171Z","title":"Efficientformer: Vision transformers at mobilenet speed,","venue":null,"work_id":"0191e6fa-0672-4fb6-b238-d490c5ed9503","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.211725Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:af53ced2d44bc5e0620aa36cd0c2de1cb549c5741ab4638b3e229bed63af5d47","observation_id":"eb2b0bd8-0742-4e1c-97a8-b659afaa2214","resolution":{"observed_at":"2026-08-10T23:48:56.132106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.118662Z","title":"Skeleton neural networks via low-rank guided filter pruning,","venue":null,"work_id":"88962305-7848-49de-ae65-b3e0d441005d","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.215105Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:d63613211e127dc4c3fffd7e2f3c931362cb39ce1def6d5e9593d5ff1c7f33ce","observation_id":"237cf01c-f407-45ee-bb41-1a78f889ccd9","resolution":{"observed_at":"2026-08-10T23:48:56.122104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.108733Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification,","venue":null,"work_id":"cc239f06-dd4a-4e68-b066-c6d609982ea1","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.218500Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:df64177d9a7e1c0aef62bb9ec071b10b155e0b1fa20532875d577071e35944d3","observation_id":"22d27ba7-c2a0-4409-9927-541081d0598a","resolution":{"observed_at":"2026-08-10T23:48:56.112682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.097486Z","title":"A-vit: Adaptive tokens for efficient vision transformer,","venue":null,"work_id":"436421d0-da6e-4094-8352-3745c903e5c1","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.221939Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:9afa277b23357bdcbdfa15adea228352c02ceede41a059ec3423fc594aaba8e2","observation_id":"1c781986-3be5-495f-addd-e51439b2ddae","resolution":{"observed_at":"2026-08-10T23:48:56.101309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.087912Z","title":"Dual-attention network for view-invariant action recognition,","venue":null,"work_id":"095a807e-ea1b-44e4-a6b5-5d617e878093","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.225383Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:df441feb36e0498b05a4efbc28b4256cd5570149d3e4c843233fd326afa76445","observation_id":"92177b92-95e3-4037-a8eb-575916603293","resolution":{"observed_at":"2026-08-10T23:48:56.091542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.078237Z","title":"View-invariant represen- tation of hand postures in the human lateral occipitotemporal cortex,","venue":null,"work_id":"69de1c1d-6415-4858-9257-cc3075ef129e","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.229352Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:4c7f8832a9e57f05db2f42d4990af00d1c5573b57e1469a3dc878f35a4d5f1fd","observation_id":"45172764-6205-478f-82e2-e362f17862db","resolution":{"observed_at":"2026-08-10T23:48:56.082174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.068798Z","title":"Deepgait: A learning deep convolutional representation for view-invariant gait recognition using joint bayesian,","venue":null,"work_id":"d5854df2-966b-44be-b15b-1f7d9dbf3477","year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.232838Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:51d2e841584468e3dc97f9dd19396228634c76e00b863be5070955c47145659e","observation_id":"bbc90614-3408-4017-8bf9-b6ecbcc574cc","resolution":{"observed_at":"2026-08-10T23:48:56.072323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.059231Z","title":"View-invariant representation and recognition of actions,","venue":null,"work_id":"97466ffa-bced-4e55-b194-09dab06413b0","year":2002},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.236516Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:3039e2e6bb98392bc0af120f25196ea72f834de4450ef85907104c3b61496417","observation_id":"df01f041-8542-4467-beb7-728163f8dea8","resolution":{"observed_at":"2026-08-10T23:48:56.062798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.049506Z","title":"View invariant human action recognition using histograms of 3d joints,","venue":null,"work_id":"fa421c41-3877-47b8-8539-fce4ef670bf3","year":2012},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.239777Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:d29dfc25a5419a4a3cd54641c52c371b9db8966730bcd0ae164fec9160062c23","observation_id":"bbaa07cf-dfa0-4c15-b3e4-790a12127bf6","resolution":{"observed_at":"2026-08-10T23:48:56.053194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.039568Z","title":"Advances in view-invariant human motion analysis: A review,","venue":null,"work_id":"17fbc0a2-e30b-4951-88f5-eab4706e7b18","year":2010},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.242975Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:2bfc133db8a84e27dea9041dbf71b87d5a9756086fcf87bbd88baf08058c6d45","observation_id":"147ac6f0-b5bd-4437-a8b0-ed290ebe946a","resolution":{"observed_at":"2026-08-10T23:48:56.043253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.029723Z","title":"Focalized contrastive view-invariant learning for self-supervised skeleton-based action recog- nition,","venue":null,"work_id":"78fe94e8-3b98-4bbf-be9d-6c06eaa7444c","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.245935Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:3122145600cda10b77f51c347ba56f98eae5fcd9d34ac81d600248f7fc1ca62a","observation_id":"8733e9f7-8f5e-4ed1-8a4b-1b2b12c7b405","resolution":{"observed_at":"2026-08-10T23:48:56.033341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.019323Z","title":"View-invariant human action recognition via view transformation network (vtn),","venue":null,"work_id":"8d440639-5ded-4d3c-8b9a-d17dc308c19e","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.248949Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:0e4dce2bc240af4ad368e62c08c9b7838237bdefd3a9f09e37f44ae6c6657f74","observation_id":"47a55d7b-0de0-40f8-bf88-ffd42aa2b80f","resolution":{"observed_at":"2026-08-10T23:48:56.023181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:56.009496Z","title":"Geinet: View-invariant gait recognition using a convolutional neural network,","venue":null,"work_id":"e3e3ca74-248c-4508-a08d-990bbb5ecbc8","year":2016},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.252657Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:54afd8a0c04cf025290811a074ad688cb6764a428a4dd22c98777141827f2750","observation_id":"07819bae-3ef5-4b44-b4e4-742ce5fd4bcb","resolution":{"observed_at":"2026-08-10T23:48:56.013083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.999402Z","title":"Learning clothing and pose invariant 3d shape representation for long-term person re-identification,","venue":null,"work_id":"e5cc9438-4ed8-4682-9304-d7a1e83511d9","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.256166Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:4125327fb10e86a99ae5524c3079bda21de192cc24a04a1848b37201d4baaae4","observation_id":"76259c72-3efa-43d7-8be4-2798d82504b5","resolution":{"observed_at":"2026-08-10T23:48:56.003042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.990245Z","title":"Aedet: Azimuth-invariant multi-view 3d object detection,","venue":null,"work_id":"d978b63f-5d08-4ee2-916c-e6ee80c7ac42","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.259146Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:7ab21b10e8bcc70b62e3b0ec2ffa716766969d876f7eddd64cd935685eda13c9","observation_id":"508fc097-dfb9-4e68-b6f2-1afc926e2417","resolution":{"observed_at":"2026-08-10T23:48:55.993592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.980507Z","title":"Learning from multiple teacher networks,","venue":null,"work_id":"4dd0731f-1e5b-4b8d-898e-af3f7065e34c","year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.262110Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:7bfe1a7bb36438f40d9d0640bf394e1fe73528a801d19b39e4293b08ea0b8710","observation_id":"cb7ef9b1-0de2-47bb-8445-1781bc0f9d0f","resolution":{"observed_at":"2026-08-10T23:48:55.984176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.970376Z","title":"M2kd: Multi-teacher multi-modal knowledge distillation for aerial view object classification,","venue":null,"work_id":"95dfe1db-1a16-4152-8733-e897172ef5a6","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.265178Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:928947098187a6c1cff8463ef593379f8b7b968078eedd18f2f0b5c1e24dfd19","observation_id":"c569da0a-f7b6-478f-aa0e-344dcd35f915","resolution":{"observed_at":"2026-08-10T23:48:55.974048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.960340Z","title":"Multi-teacher knowledge distillation for compressed video action recognition on deep neural networks,","venue":null,"work_id":"7065021f-31e9-466f-ba15-663f02ea0d31","year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.268288Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:a929bd164b941cced156141e8677dce1fbb95ec60f8cb0cdd4cf75abd70e5781","observation_id":"4ab06c36-90c0-4e93-8036-b5f06d2e66be","resolution":{"observed_at":"2026-08-10T23:48:55.963974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.950630Z","title":"Mask-guided self-distillation for visual tracking,","venue":null,"work_id":"7e153931-b97f-4cbd-9778-6b3e6785197c","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.271258Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:2ba2049a902aeffc0cb4ffc7ed180df01ede319f79d5f7c6458280a898e9ef52","observation_id":"3c3aa892-7c87-480b-933a-6d327e2cf1be","resolution":{"observed_at":"2026-08-10T23:48:55.954237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.940592Z","title":"Siamohot: A lightweight dual siamese network for onboard hyperspectral object tracking via joint spatial- spectral knowledge distillation,","venue":null,"work_id":"c6f8b335-f8fb-40fb-a9a2-0fc9a5945416","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.274235Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:128f4e21f94fdbb7463cb808a4d453a006d3628e4fa0eb2a174a3fabeb7f8112","observation_id":"8fda59d0-0feb-42bc-8eb1-2fbe1370eec8","resolution":{"observed_at":"2026-08-10T23:48:55.944608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.931481Z","title":"Model compression,","venue":null,"work_id":"7685bf2d-50f3-4b67-a1b3-aad471de3243","year":2006},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.277136Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:3439cd57f65663a9528b41ab0c4b9fe0a4cb7caa17ccd3d791abde864def1920","observation_id":"0a924cd7-bd9c-4cdc-b93f-b97ab6961e46","resolution":{"observed_at":"2026-08-10T23:48:55.934664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.922784Z","title":"Do deep nets really need to be deep?","venue":null,"work_id":"ab86b892-ffd9-4dcf-b620-f9d85c28dc29","year":2014},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.280195Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:f830531caf2be2e98d93882ce0c886204a4f95ddc5c0170b3425b0021ddd383a","observation_id":"6f4aa74f-f4b2-4c80-ab2d-acf243324aca","resolution":{"observed_at":"2026-08-10T23:48:55.926078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.912392Z","title":"Multiple teacher distillation for robust and greener models,","venue":null,"work_id":"5307b483-7e95-4413-ae8c-3de04cfc8f3c","year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.282989Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:b9b8d24633b46ca0a9967bd3a822ea422a89c1c1b38c3b8bb183995a780007ad","observation_id":"e61aa2ae-0110-44c0-ad37-5159d4805728","resolution":{"observed_at":"2026-08-10T23:48:55.916040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.901887Z","title":"Collaborative learning for deep neural net- works,","venue":null,"work_id":"d0c5455e-6725-4655-907e-c6acd3bc7463","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.285983Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:43ebfa5640fb94d41decb13422fe185c37f763c59c919fd28424e0ae02991604","observation_id":"d85f18e7-8083-4580-a243-38062e30c9c5","resolution":{"observed_at":"2026-08-10T23:48:55.906098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.892085Z","title":null,"venue":null,"work_id":"6c95fd44-4c12-4807-a53a-ae5dbe06b41b","year":2004},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.289059Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:cd3feb7a4c675fe6f4ee3be94b5c73e7162187bf94062d0a969495dd35f8d7eb","observation_id":"8ac9c6d6-4284-4a4c-a788-13e8af66f330","resolution":{"observed_at":"2026-08-10T23:48:55.895423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.882055Z","title":"On variational bounds of mutual information,","venue":null,"work_id":"4dfc36f9-d2f1-41f2-9ea5-e6027752001c","year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.293224Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:68f48d41f671956afc6ba8c8730b6b46ffaea4066a71535b16867e0673a673d2","observation_id":"7212f058-1510-40d6-afe9-81f0199a3411","resolution":{"observed_at":"2026-08-10T23:48:55.885495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08919","last_updated":"2021-05-19T04:40:53Z","snapshot_observed_at":"2026-08-02T14:17:07.129681Z","submitted_at":"2021-05-19T04:40:53Z","title":"Comparing Kullback-Leibler Divergence and Mean Squared Error Loss in Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08919","snapshot_observed_at":"2026-08-10T23:48:55.296555Z","title":"Comparing kullback- leibler divergence and mean squared error loss in knowledge distilla- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.296555Z"},"links":{"cited_paper":"/paper/2105.08919","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:051224b578e51903f38bb0dd484b281573b80b34e72963d46efcfa49381334fd","observation_id":"030fcba6-e0fc-4892-87aa-d58ba688385a","resolution":{"observed_at":"2026-08-10T23:48:55.296555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18041","last_updated":"2024-07-25T13:39:11Z","snapshot_observed_at":"2026-08-02T09:33:38.410063Z","submitted_at":"2024-07-25T13:39:11Z","title":"How to Train the Teacher Model for Effective Knowledge Distillation","version":1},"cited_work":{"arxiv_id":"2407.18041","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18041","snapshot_observed_at":"2026-08-10T23:48:55.473026Z","title":"How to Train the Teacher Model for Effective Knowledge Distillation","venue":"cs.LG","work_id":"f72f1581-85a3-41e7-b01c-61b281e64e9f","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.299923Z"},"links":{"cited_paper":"/paper/2407.18041","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:f9304cf65f5c88b99219a46a5822e5981d60633fed586cb65e04a957d9d2dcf5","observation_id":"b60d5c00-98af-4122-9e3f-a272f03ceab8","resolution":{"observed_at":"2026-08-10T23:48:55.476741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.872188Z","title":"Cornernet: Detecting objects as paired key- points,","venue":null,"work_id":"2735f6c3-09fe-463b-ba4b-9ed839a8b99b","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.303558Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:692a2781dde9c2f92ece76c8dcf9a39a916af4144940751b4b095a882960d10c","observation_id":"b9caea68-058a-487a-937a-2cdbfa21391c","resolution":{"observed_at":"2026-08-10T23:48:55.875826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.862141Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression,","venue":null,"work_id":"d1cb5caf-3ebf-4267-b1ad-5b3ddcf93d8d","year":2019},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.306846Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:a99ff86b0fc363235e14b88fd7419e57ac40cd4f5e5851573372ab2b83c281f1","observation_id":"71be65d6-c4e3-4ac8-9cea-de8c256516fd","resolution":{"observed_at":"2026-08-10T23:48:55.865744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.852717Z","title":"Visual object tracking for unmanned aerial vehicles: A benchmark and new motion models,","venue":null,"work_id":"7dcc370a-965b-4529-bad5-695938dc3085","year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.310159Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:54c59f01f568f1641b26966ce8a8b12c492fa4d02abfd489cace83ec12877ce4","observation_id":"c4834399-872d-4c86-9dd5-8140131f1376","resolution":{"observed_at":"2026-08-10T23:48:55.856189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.843053Z","title":"The unmanned aerial vehicle benchmark: Object detection and tracking,","venue":null,"work_id":"eb0ad435-c822-426d-b243-68bd51d12d03","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.313197Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:10811d31aecff90170f87bd5b67c973e8be40444175ff590ec55235f85e56619","observation_id":"96a9ff92-da40-4a8d-9b5e-d83b86c5c801","resolution":{"observed_at":"2026-08-10T23:48:55.846814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.832829Z","title":"Visdrone-sot2018: The vision meets drone single-object tracking challenge results,","venue":null,"work_id":"9d263efa-8880-4947-a4fa-37515d2de075","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.316402Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:1ccafa8b2d0c9ce77991acb3bb962a641272f132b229afad2e40140d137bb5da","observation_id":"b3ccadee-b857-4502-becc-58275c95b8e1","resolution":{"observed_at":"2026-08-10T23:48:55.836306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.822334Z","title":"Discriminative scale space track- ing,","venue":null,"work_id":"39c6912e-0afb-4c83-8572-a8d1bcc7294b","year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.319622Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:6f5c80329bfc40b5efce3d091ad74ad14f6f3459667700dc7abb6ad1201e49aa","observation_id":"9fbed073-7203-49fd-a5ee-d2a36ceeb7bf","resolution":{"observed_at":"2026-08-10T23:48:55.825873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.811737Z","title":"Eco: Efficient convolution operators for tracking,","venue":null,"work_id":"0387ccab-f6ed-4c0f-bedf-cdd0a32a0179","year":2017},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.322793Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:90958d217158fc3abbfdbef3c4371b5b46ba3b93e5b3a4cf494ccadc30c8872b","observation_id":"3a2742fe-94aa-46d1-8399-4ffbe14ef501","resolution":{"observed_at":"2026-08-10T23:48:55.815780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.801240Z","title":"Multi-cue correlation filters for robust visual tracking,","venue":null,"work_id":"fd002e97-8f4b-46de-8dc5-a07bb06c7d6c","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.325822Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:d203e5a2cb947f1724d5524e0a2c104906352273c60b1ae8e9f93a5c5a6f9bb0","observation_id":"de7f1622-5733-4631-a534-ea7b5a465aca","resolution":{"observed_at":"2026-08-10T23:48:55.804734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.788663Z","title":"Learning spatial-temporal regularized correlation filters for visual tracking,","venue":null,"work_id":"ed7ce7a8-28a8-47b1-ba48-d3218db65a52","year":2018},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.328907Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:f21f35e583317f3ec2ad626ef0653c26c510d2c32c95e42aadb4aa491d4b641d","observation_id":"89c57de7-b5d1-410b-98da-144fee56c743","resolution":{"observed_at":"2026-08-10T23:48:55.792446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.776320Z","title":"Learning residue-aware correlation filters and refining scale for real-time uav tracking,","venue":null,"work_id":"7c95ad38-75df-4216-9527-faa2d9675ade","year":2022},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.332106Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:b22cc0d364821b24674eb80adb329eb6b1799a4223919bdaac6d65a76f7e716a","observation_id":"36e1b4c1-f745-4133-bdf1-a2c381869cb8","resolution":{"observed_at":"2026-08-10T23:48:55.781430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.765452Z","title":"Towards real-world visual tracking with temporal contexts,","venue":null,"work_id":"a426860e-1851-4552-a7e4-0e5572ada4ae","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.335090Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:b3c29d50c3dc0b6b5cf65bd4611e7685c68b7c4bf0e0b6c4cb2fa56d08ae29a4","observation_id":"3cca9900-e7fc-452e-9da9-384375c0f2fe","resolution":{"observed_at":"2026-08-10T23:48:55.769515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.754979Z","title":"Sgdvit: Saliency-guided dynamic vision transformer for uav tracking,","venue":null,"work_id":"0fbbad9a-0171-43b3-aff7-4f1ba9b3dd1a","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.338232Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:0f41bd937ecef943dfbb67955c745cfad97de307575d6d285ac3639733a18f55","observation_id":"69463c63-fcc4-49aa-9227-7f8634341bf5","resolution":{"observed_at":"2026-08-10T23:48:55.758886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.745218Z","title":"Adversarial blur-deblur network for robust uav tracking,","venue":null,"work_id":"42751e6d-5a84-415b-a2bc-00d0de8a914a","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.341140Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:8e2f66119af66dfaa7794fbb868d8aa4cfdf62304f0dc5f5187143d801e0683f","observation_id":"55e56bfb-4ce9-43e9-bbf7-845af1a76b84","resolution":{"observed_at":"2026-08-10T23:48:55.748651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.735533Z","title":"Towards discriminative representations with contrastive instances for real-time uav tracking,","venue":null,"work_id":"f1b5f2ff-5897-4dc2-b73f-f1e67d03ce5b","year":2023},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.344009Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:ef076a437bf584e5da49b1045eb16e021ff596106fe42551cefce05f992b9ba7","observation_id":"b2d1676a-ef67-4e4f-bc51-402181fe321e","resolution":{"observed_at":"2026-08-10T23:48:55.739270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16652","last_updated":"2024-09-25T06:16:32Z","snapshot_observed_at":"2026-07-06T19:21:37.545087Z","submitted_at":"2024-09-25T06:16:32Z","title":"Progressive Representation Learning for Real-Time UAV Tracking","version":1},"cited_work":{"arxiv_id":"2409.16652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16652","snapshot_observed_at":"2026-08-10T23:48:55.457810Z","title":"Progressive Representation Learning for Real-Time UAV Tracking","venue":"cs.CV","work_id":"67d16aed-8402-403e-b31b-a960b2718f18","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.346967Z"},"links":{"cited_paper":"/paper/2409.16652","citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:0a4c725c77b1deb9e38eed85527c0e6bdb4f8e63cfdc4bca9af8ec3f3e392712","observation_id":"d5b3f7c8-1ab1-4b6c-9b1e-74b3ae555414","resolution":{"observed_at":"2026-08-10T23:48:55.463332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.725617Z","title":"Litetrack: Layer pruning with asyn- chronous feature extraction for lightweight and efficient visual track- ing,","venue":null,"work_id":"ca1726b2-5456-431f-9e9e-70af2304b7b1","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.350232Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:5cf9aaefb4c3af1cfa22aa1772e853764afa766824fe402c3973402835376ac2","observation_id":"0df3c225-583e-4584-8cdd-c8e1fcdf73a7","resolution":{"observed_at":"2026-08-10T23:48:55.729516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.715464Z","title":"Separable self and mixed attention transformers for efficient object tracking,","venue":null,"work_id":"40cfef34-f0b0-4352-9f61-7e88df65396d","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.353238Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:f812f0e128d84544f7519a0c440f71da3873eb1fc5541ed7745e298cefb8f780","observation_id":"52a88f1b-1a50-4073-9a98-212475a25080","resolution":{"observed_at":"2026-08-10T23:48:55.719075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.705824Z","title":"Lightweight full- convolutional siamese tracker,","venue":null,"work_id":"cd598b28-4325-4ae8-80aa-fe5b91818909","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.356497Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:e7e2da92f85f5e992be99fe58126c633ddb3ad3c514782218417a60b0e434f76","observation_id":"04ee5464-eb80-44bc-8a1b-a755c5470fb2","resolution":{"observed_at":"2026-08-10T23:48:55.709501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:48:55.695285Z","title":"Correlation-embedded trans- former tracking: A single-branch framework,","venue":null,"work_id":"042f98f4-48ee-4020-9d9b-c9cfe01c59ca","year":2024},"citing_paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:55.359897Z"},"links":{"citing_paper":"/paper/2412.20002"},"observation_digest":"sha256:c9a90bf909a0807b96cf1daada350541abf6d646eb3322e0518047857fe7d3c1","observation_id":"0daaa7ca-8f3a-48a5-a367-52c5adadbfa3","resolution":{"observed_at":"2026-08-10T23:48:55.699055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20002","last_updated":"2025-08-15T05:08:16Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:38:16.846040Z","submitted_at":"2024-12-28T03:57:44Z","title":"Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 0 inbound Pith citation observations for arXiv:2412.20002."}