{"as_of":"2026-08-15T17:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bb41b889772ed984ef3e4cbc27db8899f39d4a3127de059ed1600f10585265c","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:50:02.710448Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02197/citation-record","integrity":"/paper/2412.02197/integrity","json":"/paper/2412.02197/citation-record.json","paper":"/paper/2412.02197"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.264917Z","title":"High- erhrnet: Scale-aware representation learning for bottom-up human pose estimation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.264917Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:c01cc0f9a3fb83b869668061150763933ed1043f90f2b78da710544c82b6bbb0","observation_id":"d4e34c95-c5c2-4214-9d18-dedf04f696f6","resolution":{"observed_at":"2026-08-11T23:50:02.264917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.766272Z","title":"Hrformer: High-resolution vision transformer for dense predict,","venue":null,"work_id":"591b0316-89f3-4bc3-8eb7-5f473907019a","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.270969Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f443b21b6d01dfc027bbd2817c47c9d06c76d8a8fd96a01f5b7696388ae68916","observation_id":"f05f1240-1974-4cf9-ab1b-e397c38ea079","resolution":{"observed_at":"2026-08-11T23:50:03.771734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.749768Z","title":"Lite pose: Efficient architecture design for 2d human pose estimation,","venue":null,"work_id":"771b3516-8c6a-4c0e-98f3-e99bf7724ca0","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.279056Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:531c9983832e2420e634dffc1d54e228c7f513183f2f0b3fed73aca1577272f1","observation_id":"02a20135-e84e-48b6-8730-5bff9bc0e0fb","resolution":{"observed_at":"2026-08-11T23:50:03.754600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.734578Z","title":"Tempose: A new skeleton-based transformer model designed for fine-grained motion recognition in badminton,","venue":null,"work_id":"7d674921-e511-468c-901e-c8b706585506","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.285948Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:54c9ec6131a8a4ac3773f1bdb43964843697a9b690e6abd825607252c980094e","observation_id":"f57db4af-1f7c-4088-b59a-b80f132969c4","resolution":{"observed_at":"2026-08-11T23:50:03.739547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.304734Z","title":"Hiformer: Hierarchical multi-scale representations using transformers for medical image segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.304734Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:6d8d1a358a836df0c3a4eb9ac54986804fd3e03ac706af002eb1b9c05ce322f7","observation_id":"5f03b706-f9d3-41d2-80c0-15bcda58a414","resolution":{"observed_at":"2026-08-11T23:50:02.304734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.314721Z","title":"Deep high-resolution repre- sentation learning for human pose estimation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.314721Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:2b98c9d9af67c82bef8df72aefa6cb22946c5534e584ac62b1bca3612e8524a7","observation_id":"6e676b1f-7d42-4a4f-8db4-85198cbd34a8","resolution":{"observed_at":"2026-08-11T23:50:02.314721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.320573Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.320573Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:11fc72a43e6042cc76bb665f7a62b965349eae2b655d9d55494182191831d184","observation_id":"4fc4d1d0-e95b-4390-af13-03b97360d40b","resolution":{"observed_at":"2026-08-11T23:50:02.320573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.687011Z","title":"Sg-former: Self-guided transformer with evolving token reallocation,","venue":null,"work_id":"9fd1032c-f05d-4d2c-b40f-4720d01d4ed1","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.325399Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:86243352950b2c7ad1bdb33e99f2374dc0af6cf3b139fd0b585870815409bd23","observation_id":"99823c61-5dbd-4b81-b905-7aeaf5f80594","resolution":{"observed_at":"2026-08-11T23:50:03.692571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.670175Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention,","venue":null,"work_id":"1735e190-0e66-4207-97f5-20af159f3c29","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.330421Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:0dca1eee8d1ce99a4fb1a1015af98605ca8913b998e6108b17a97f12a38b7b34","observation_id":"116c4406-e640-4be0-9840-bdc0fb56b0d9","resolution":{"observed_at":"2026-08-11T23:50:03.675288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.338752Z","title":"Crossvit: Cross-attention multi- scale vision transformer for image classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.338752Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:27ac39384031538fd3fb26531dd493ff526d89de334cffc76d9087325fc9a348","observation_id":"ded43b40-0428-4edf-838c-80f23b127bdd","resolution":{"observed_at":"2026-08-11T23:50:02.338752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.643700Z","title":"Few-shot object detection with fully cross-transformer,","venue":null,"work_id":"c9273663-a08f-4cbe-a131-f1078690d73e","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.344023Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:0b61872740e9db332501fd2214e09bcf79441fe448d80ed82e2be3c733ec4f34","observation_id":"333918da-ac2b-4746-a0a4-4eef2d03b3a2","resolution":{"observed_at":"2026-08-11T23:50:03.648244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.629041Z","title":"Topformer: Token pyramid transformer for mobile semantic segmentation,","venue":null,"work_id":"08b8e8b7-38b4-4748-bc34-778feba3e09f","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.350434Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:4b15dfe69f8f981ee65ff3265553b07b641a256af22efe4207b8b82089db90b9","observation_id":"7aeb8b03-9f1c-4403-9e87-7c4490173e1f","resolution":{"observed_at":"2026-08-11T23:50:03.633543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.611489Z","title":"P2t: Pyramid pooling transformer for scene understanding,","venue":null,"work_id":"b523c313-7b0b-491a-8d8b-3476f56d5310","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.356129Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:ff081f50570ea516b6a8229ebc2c107031237f7305215925c070e76dfb22bcf4","observation_id":"2c7281bc-e865-44df-b09f-d5ba852a6f3c","resolution":{"observed_at":"2026-08-11T23:50:03.616309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.360826Z","title":"Shunted self-attention via multi-scale token aggregation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.360826Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:14d4e21893c8eb445fb9936ba4ac31efeadcb08ba451e0dc1ad2d5112d5ccd80","observation_id":"52a26bbb-a47b-4e9a-bab1-c0980fa49f24","resolution":{"observed_at":"2026-08-11T23:50:02.360826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.365839Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.365839Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:1cde4d64e319af475d6bef1a669ed9ead05875e9dbfaaf9ca34fc11a8f7e0f8d","observation_id":"f00c7eb1-dcc9-43d8-b774-c8d335dfcc0d","resolution":{"observed_at":"2026-08-11T23:50:02.365839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.573979Z","title":"Scale-aware modula- tion meet transformer,","venue":null,"work_id":"77ff8f77-caf2-4e05-9ec6-332e438a2ef5","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.370732Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:821f21793f33723ac85538f4def0b209c6439b5bdd99f1cdb5211f9d9e0c143c","observation_id":"62d61b90-4cb8-4840-98e5-87b93e06264c","resolution":{"observed_at":"2026-08-11T23:50:03.579503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.555460Z","title":"Sbcformer: Lightweight network capable of full-size imagenet classification at 1 fps on single board computers,","venue":null,"work_id":"08386aa8-0e3b-4374-bc3f-72275ec9aedf","year":2024},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.377987Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f689cae2485617cee60482c1043c28f1f05f290405dc7864ed392ad65a3d7ab0","observation_id":"9e791be2-237c-439d-bedd-b283e764f2ff","resolution":{"observed_at":"2026-08-11T23:50:03.560595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.539271Z","title":"Task-driven super resolu- tion: Object detection in low-resolution images,","venue":null,"work_id":"6a4de24a-b0e4-4730-8abb-ba2a61f48be8","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.390726Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:37c67df54edd7badb111c229318424d722358a056fdda6877e3c3055891d4c0f","observation_id":"a5be51c4-2d5b-4abe-a675-caf5d3c22730","resolution":{"observed_at":"2026-08-11T23:50:03.543854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.524890Z","title":"Derivenet for (very) low resolution image classification,","venue":null,"work_id":"d1f03bad-0d8e-43a8-b6b4-9aaed000ba6d","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.395187Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:65cb56fa688856e4d1495d466b2ec3b6bd3cf88bdc4e3ae70048361f5c05fbbd","observation_id":"9bdc5457-1ffe-4b64-b22c-22f7fbbf8a8d","resolution":{"observed_at":"2026-08-11T23:50:03.528926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.511092Z","title":"Image super-resolution with non-local sparse attention,","venue":null,"work_id":"cd0a7110-f838-462f-be71-a664928081d0","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.401518Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f80990aad4927a767b7f891cfaecd60fa3696643b8171cde81174969bdc73e2e","observation_id":"22eed04d-5ad4-4645-a364-61eb3201fb40","resolution":{"observed_at":"2026-08-11T23:50:03.515470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.496413Z","title":"Low-resolution human pose estimation,","venue":null,"work_id":"2dca5f28-a73e-4080-985b-74119ed2f42f","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.406260Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:4eb802cc63477fd049c89e56da1a2053cc0582bf19f01188022cf7e3d4e22c52","observation_id":"90f3d0fa-b389-4a15-b933-b931ad2e2b5a","resolution":{"observed_at":"2026-08-11T23:50:03.501150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.421979Z","title":"Feature map distillation of thin nets for low-resolution object recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.421979Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:2426474dd77c53b8a637b16e5022ee701a2c37b4b84f76e1c6a8c1feb2e3c5ac","observation_id":"d9a048ec-fb12-42c1-9625-8b9b19e8c16f","resolution":{"observed_at":"2026-08-11T23:50:02.421979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.471193Z","title":"Transformer for single image super-resolution,","venue":null,"work_id":"a3602342-5567-4d4e-b1bf-7e686ae115c6","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.432688Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:947b564e8f5ed69add567f49de91306d55d9cc9138d8c052fd6349bdffcba01e","observation_id":"674cae0e-4619-44b7-8e18-d1bd8dd50f8c","resolution":{"observed_at":"2026-08-11T23:50:03.475659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.439120Z","title":"Essaformer: Efficient transformer for hyperspectral image super- resolution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.439120Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:8dc69d05214386cf6cd09506ecd53a0dc664949b1f32735359d79ceb9610ec3d","observation_id":"05a805f0-af10-4a5b-808e-3a1177e97e21","resolution":{"observed_at":"2026-08-11T23:50:02.439120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.446678Z","title":"Steformer: Efficient stereo image super- resolution with transformer,","venue":null,"work_id":"9e993579-e5b2-4a03-9ace-88ed607e6163","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.446018Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:4c3c42bf13283d3d56119f4db9c607a7370ededf653e391bab81e94580a39d56","observation_id":"b0168ad9-9a09-46a7-b2ec-f1574688b0b8","resolution":{"observed_at":"2026-08-11T23:50:03.451288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.432813Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale,","venue":null,"work_id":"17e71757-9990-4cd6-8768-2f4211495555","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.450188Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:9ff1e182f8be256aed668fdc8bc0c0970f99879f356fde6eb8150292377e8352","observation_id":"41d60586-7b91-4826-8596-c058cd811d58","resolution":{"observed_at":"2026-08-11T23:50:03.437144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.457761Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.457761Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:1ee4421db98c514e084610eb07282662734f0a94529325bbcaae50982f30868b","observation_id":"7ddb1580-2615-4625-a987-b36302932562","resolution":{"observed_at":"2026-08-11T23:50:02.457761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.407755Z","title":"Neighborhood attention transformer,","venue":null,"work_id":"a46d865a-c944-45a0-a2f6-d0ce254794d6","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.462047Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:61b4bcb39119cae802092bf28e574713dfae0d6ddadc9f925989b53c8a53b932","observation_id":"f678b933-2780-487b-88fc-62f9ef5a671a","resolution":{"observed_at":"2026-08-11T23:50:03.412138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.385832Z","title":"Vision transformer with quad- rangle attention,","venue":null,"work_id":"b59cc225-5dda-49dd-a9d3-38683351d05f","year":2024},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.466678Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:031184d6612d5c0e21c056ee6887f55a766b1cd65cc9f10d219c57548d1bfd37","observation_id":"399839dd-3d68-4bd5-a963-a3f0b1a95fa6","resolution":{"observed_at":"2026-08-11T23:50:03.397126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.367970Z","title":"Mobilevit: Light-weight, general-purpose, and mobile-friendly vision transformer,","venue":null,"work_id":"8e0215e5-6e60-4102-a659-d47a919e7441","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.472426Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:3239516661156df92d7f0513b84b64cf897cc9200da6f394d65ac330c5a3fcf5","observation_id":"a326f272-319f-4ae0-800d-cde0a5885c5d","resolution":{"observed_at":"2026-08-11T23:50:03.373476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08059","last_updated":"2023-09-04T12:47:28Z","snapshot_observed_at":"2026-08-13T13:20:35.474239Z","submitted_at":"2022-12-15T18:59:12Z","title":"Rethinking Vision Transformers for MobileNet Size and Speed","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08059","snapshot_observed_at":"2026-08-11T23:50:02.478584Z","title":"Rethinking vision transformers for mobilenet size and speed,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.478584Z"},"links":{"cited_paper":"/paper/2212.08059","citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:dcfd4f9f7b2e26523d51c0729495c00636ddcd363ef86c7c95fb94e254ce2510","observation_id":"920b8e25-02cf-47b3-9266-13d5f65bb66f","resolution":{"observed_at":"2026-08-11T23:50:02.478584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01146","last_updated":"2023-08-14T08:54:43Z","snapshot_observed_at":"2026-08-13T13:10:21.732638Z","submitted_at":"2023-01-03T15:11:41Z","title":"Rethinking Mobile Block for Efficient Attention-based Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.01146","snapshot_observed_at":"2026-08-11T23:50:02.483817Z","title":"Rethinking mobile block for efficient neural models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.483817Z"},"links":{"cited_paper":"/paper/2301.01146","citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:0aa2814bbe1182f28ef8c6484c1e04798d2065da932abac639cb6fb62aba40c2","observation_id":"2b03565e-de20-4670-ab48-4afcfb4b8a1c","resolution":{"observed_at":"2026-08-11T23:50:02.483817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14189","last_updated":"2023-08-17T21:10:59Z","snapshot_observed_at":"2026-08-13T12:17:30.975465Z","submitted_at":"2023-03-24T17:58:32Z","title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14189","snapshot_observed_at":"2026-08-11T23:50:02.489198Z","title":"Fastvit: A fast hybrid vision transformer using structural reparameterization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.489198Z"},"links":{"cited_paper":"/paper/2303.14189","citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:160612fa72e142f01212bd7e76f4405c45a519f375abc86bf6b7cf311bcfaa68","observation_id":"5b7de592-2ac9-4240-bbdc-634e3537f5f4","resolution":{"observed_at":"2026-08-11T23:50:02.489198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.493632Z","title":"Repvit: Revisiting mobile cnn from vit perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.493632Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:00018051383dddfff543df3182f5ded052b1f834dcf75aed8800f957a0bedfd8","observation_id":"d60f5ae1-fa31-4320-adc3-b1b8230a13f5","resolution":{"observed_at":"2026-08-11T23:50:02.493632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.339432Z","title":"Hydra atten- tion: Efficient attention with many heads,","venue":null,"work_id":"76983b62-60d2-4fd4-9f9a-7c5b960eed2c","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.501186Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:d63b4fc96fd23b1ea0e8853c3bf6b7c5a106912a85e38a40b480366aad7efa5a","observation_id":"84da336e-47a1-4094-bc0e-a533e7cd9665","resolution":{"observed_at":"2026-08-11T23:50:03.344162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.323560Z","title":"The principle of diversity: Training stronger vision transformers calls for reducing all levels of redundancy,","venue":null,"work_id":"b26ac7bf-d1e2-4ed9-a176-c9b2f809d584","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.509778Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:ed154f154842503b1bb20e3a31b731e38de64e230c99681558506ad246237607","observation_id":"a00236d8-38ff-45e8-838a-686d92bc912e","resolution":{"observed_at":"2026-08-11T23:50:03.328010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.307891Z","title":"Levit: a vision transformer in convnet’s clothing for faster inference,","venue":null,"work_id":"9a6e41c3-ec47-4600-813d-e40c620e0d94","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.515379Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:40765175c3266eaf43debdfe9a211b661cf2fa1879720ba0cf193a5db12f85ac","observation_id":"5e126892-c06d-49b9-891a-c3fe1ebcc9dd","resolution":{"observed_at":"2026-08-11T23:50:03.312628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.519595Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.519595Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:9a1d7a2cc9df5c8a52057fcb22cc8766bcd556a885f4098b993f9ccdd2a52356","observation_id":"925d0235-9254-44e4-9aee-936f802f13ba","resolution":{"observed_at":"2026-08-11T23:50:02.519595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.527001Z","title":"Cmt: Convolutional neural networks meet vision transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.527001Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:a6852a207170f13a5e087824f1b13121234c852b1afeadaf4d452696f6ae5a33","observation_id":"a85bac8b-ed73-4ea6-8240-9435546dcb03","resolution":{"observed_at":"2026-08-11T23:50:02.527001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-10T23:32:09.056322Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-11T23:50:02.532771Z","title":"Con- ditional positional encodings for vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.532771Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:42cf580a0903f540bf5a4cf2f90bb65dcc5532ed8488ff0c6cafd9394f5b9ba8","observation_id":"b386e4cd-13ee-4c80-af45-d2e5fded5d59","resolution":{"observed_at":"2026-08-11T23:50:02.532771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.257510Z","title":"Diverse branch block: Building a convolution as an inception-like unit,","venue":null,"work_id":"233d7a07-117a-459e-bdc7-49fc3cb3b277","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.546139Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:40fe1fad44060646f512b1b6bc7928276b79b46e6ac3ea24446601cc430b0c60","observation_id":"4822cba1-b589-4170-85a2-2cebd9474429","resolution":{"observed_at":"2026-08-11T23:50:03.262955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.230172Z","title":"Mobileone: An improved one millisecond mobile backbone,","venue":null,"work_id":"4bf7406d-2758-44c4-9318-9e3a8752a49e","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.558652Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:ac86a1a669f36de950cf208d2debdb5879851c9797cbacfd3ac204406103ddd6","observation_id":"460025ce-b10e-4427-b64e-928c76e4ccde","resolution":{"observed_at":"2026-08-11T23:50:03.234807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.576613Z","title":"Simple baselines for human pose estimation and tracking,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.576613Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:1d55e0cb4ddeec6424d0a17a1845fa7c9ff604c63e492bec28112c79a42150c2","observation_id":"b4f7e7df-74b2-4672-91ad-1f0cd0db6218","resolution":{"observed_at":"2026-08-11T23:50:02.576613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.200117Z","title":"Distribution-aware coordinate representation for human pose estimation,","venue":null,"work_id":"d745969b-0862-4a94-a981-d11fe6f55df1","year":2020},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.582510Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:de91a1934374a8ee784a0f9341e1e054d47c7d403557b8ef03107f898d81a975","observation_id":"0000e52f-b887-4a37-8d83-a83f149b5797","resolution":{"observed_at":"2026-08-11T23:50:03.204823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.184798Z","title":"The devil is in the details: Delving into unbiased data processing for human pose estimation,","venue":null,"work_id":"76c39e16-0f21-40fd-8c04-d3996c987659","year":2020},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.587505Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:150e4445bdd99d3aed801c5921f027153714ae87a68432d72905c29b526f303d","observation_id":"52fc997c-a603-4d81-98b2-aaeb2c6a895f","resolution":{"observed_at":"2026-08-11T23:50:03.189313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.593229Z","title":"Vitpose: Simple vision transformer baselines for human pose estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.593229Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:70544db9ac9d80baadb80181ad860a92c1ffe9f562966508eca220b2bea74a31","observation_id":"f0a3c97b-27bf-418e-9f5e-f4a90619ea2c","resolution":{"observed_at":"2026-08-11T23:50:02.593229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.158040Z","title":"Human pose as compositional tokens,","venue":null,"work_id":"d2238560-df1b-4ac1-b788-2609d300fe9b","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.597860Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:c6e9fc33462aa20e4784ec142e10f4c87e54bafa0c689ba03d286e3387cd5cc4","observation_id":"8592d426-fdf4-447d-bb2d-e125e8df706f","resolution":{"observed_at":"2026-08-11T23:50:03.162887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.602493Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.602493Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:df047a5d3133d0c46d2c36a6ed6205fe8bdfe369bb03c8cded4377e90cb3a342","observation_id":"4c8990d9-08a3-4ab9-8b5f-b9edc4ef30b6","resolution":{"observed_at":"2026-08-11T23:50:02.602493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.130263Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":"8c66ec8c-3f59-4eb4-971c-6892a52a37fe","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.607601Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:60458d88eac4f903889e6cdc94eb8e0f202bc29bc0bc459d3d21845860b8e90b","observation_id":"c25f6ef2-26c1-4ac5-bcea-cca814886d61","resolution":{"observed_at":"2026-08-11T23:50:03.135763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.114827Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"202c45da-a7da-44ed-8e2f-90a636cb79bb","year":2019},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.612501Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:eab32fc9a59882e2c92c76d3935756dbc00184085d2677d2460122e627cf440e","observation_id":"ed5a885c-7ef1-4e3a-ae85-f21c8c3c0c09","resolution":{"observed_at":"2026-08-11T23:50:03.119294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.099259Z","title":"Face alignment across large poses: A 3d solution,","venue":null,"work_id":"faeefde5-cb54-4783-b14a-fcd25ff15e5c","year":2016},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.616620Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:93155f456dbb7de3fa90d7caff9d4bbf9c6160aef3b67835a3cba3c3b982ffb8","observation_id":"0ec06288-4d66-4803-bb5e-924e450f6c55","resolution":{"observed_at":"2026-08-11T23:50:03.104048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.081560Z","title":"Random forests for real time 3d face analysis,","venue":null,"work_id":"c59eb2ec-2a95-4d40-9e92-93bfce2ca2d9","year":2013},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.621512Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:eba9bd5ee36e75a4f55f2138dfbac31d8fa28505e73eaf0332ab4f84ad77eff2","observation_id":"8ede41d2-e327-414f-af8b-703f00ca17a2","resolution":{"observed_at":"2026-08-11T23:50:03.086779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.066177Z","title":"Fine-grained head pose estimation without keypoints,","venue":null,"work_id":"6f938556-ecaf-46f8-8c62-10e8dd27aed3","year":2018},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.625679Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f0586b572532d07189b7aad37b5a00c4297b1cfec12994fc7c820aa01091f284","observation_id":"63c55ea2-9bb7-430b-b1b0-319528d3eddd","resolution":{"observed_at":"2026-08-11T23:50:03.070784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.050692Z","title":"Fsa-net: Learning fine-grained structure aggregation for head pose estimation from a single image,","venue":null,"work_id":"02998e40-28c1-4ea7-ad5d-fd5510bcd15b","year":2019},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.633614Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:06eed7f1b06805620658c749cc0656290c08175b0b1640c103db0bd331dabdeb","observation_id":"83c6bc86-a4db-4063-8a24-588de7b1bd84","resolution":{"observed_at":"2026-08-11T23:50:03.055685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.639745Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.639745Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:bf6c76693a6ae2ec7278ee328d9baac387df89f65d986997537f7e17b37ab495","observation_id":"3a2f0abf-f422-4e98-8f60-9e2a1fe89e18","resolution":{"observed_at":"2026-08-11T23:50:02.639745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.026491Z","title":"Improving head pose estimation with a combined loss and bounding box margin adjustment,","venue":null,"work_id":"b1808bcb-3e67-49d1-a25d-8c25edbe7fbd","year":2019},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.643975Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f911be741a003719fc98b6fc37e57c490cbb369029aeb3ff938e37378b9a99c1","observation_id":"fb545052-10fd-483b-a0e1-d6e1a688f3ba","resolution":{"observed_at":"2026-08-11T23:50:03.030877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:03.012902Z","title":"Whenet: Real-time fine-grained estimation for wide range head pose,","venue":null,"work_id":"7568da59-5d29-4603-b47e-19434151a4ff","year":2020},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.647967Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:65eb78efdb2eee45434d9b947cc0ee4cce6e21cfe4a64b40dbdec44ad91f7f79","observation_id":"88f0e53b-f7be-492c-9e8b-2db7e7945837","resolution":{"observed_at":"2026-08-11T23:50:03.017254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.997100Z","title":"Tokenhpe: Learning orientation tokens for efficient head pose estimation via transformers,","venue":null,"work_id":"b783100f-271a-4d2b-8ad6-2cbd3c8b838b","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.653242Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:00dfedef4fe38cdb55c943d9bafa16f5a54acede3cdf15763976898ae95097c4","observation_id":"f851c8b2-5378-4f6e-8da1-1a177c773772","resolution":{"observed_at":"2026-08-11T23:50:03.002281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.982376Z","title":"Fdn: Feature decoupling net- work for head pose estimation,","venue":null,"work_id":"ed25a560-326d-49fd-b401-2d309f5b5c90","year":2020},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.657499Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:940bb4eed3acb400122280bfdf3883b1533a807271c2e3a8db30ce37b5c64e8a","observation_id":"bab87137-c61d-4f2f-a3c7-286247f85918","resolution":{"observed_at":"2026-08-11T23:50:02.986726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.967001Z","title":"Accurate head pose estima- tion using image rectification and a lightweight convolutional neural network,","venue":null,"work_id":"ae3eae59-411e-4a00-9b31-25b24379f688","year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.663223Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:1d23450eb963588b2ccf5c6aa4816c7aff670e20e2f61f9e39365fa0d9efafc9","observation_id":"354e7600-0c10-432c-a52f-4ffd7ce5a952","resolution":{"observed_at":"2026-08-11T23:50:02.972268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.952896Z","title":"Eva-gcn: Head pose estimation based on graph convolutional networks,","venue":null,"work_id":"97025018-1c3f-4e4c-b764-a36bacb639ac","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.667877Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:2f19cda75582283db46844d9c0c49691c069967c5f37169c8178d2ceed7aeaa0","observation_id":"b353beb2-dda7-4d33-bd67-7e6028e68aa0","resolution":{"observed_at":"2026-08-11T23:50:02.957117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.938030Z","title":"Mfdnet: Collaborative poses perception and matrix fisher distribution for head pose estimation,","venue":null,"work_id":"5eed55ba-728b-4236-b4dd-1db6c5d8b56e","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.672555Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:0e7d168f21ff36fe4ae94cf1e5fb741342c9b180cb472c338d0625b5f9731210","observation_id":"4ee5dc7d-81b3-48ea-9a04-ef7b599f6c61","resolution":{"observed_at":"2026-08-11T23:50:02.942840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.922037Z","title":"Real-time 6dof full-range markerless head pose estimation,","venue":null,"work_id":"ec699cde-5c8e-4c9f-ab8f-c06908d0f78f","year":2024},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.677472Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:1c8036b80b9d992f91578eb81ac0fab2d13c65cfedbeb94ed9595b205ad278ee","observation_id":"44b1e286-1ac9-4c7d-8e0a-417106b14f2e","resolution":{"observed_at":"2026-08-11T23:50:02.926619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.681989Z","title":"Toward robust and unconstrained full range of rotation head pose estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.681989Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f4752d38e8dda19677b512c8e7c65279b73ca2ddbfdd0e79b14465b0ce280fb0","observation_id":"29270784-2693-40e6-ad73-fa788ae408b0","resolution":{"observed_at":"2026-08-11T23:50:02.681989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.896755Z","title":"A vector-based representation to enhance head pose estimation,","venue":null,"work_id":"d15588aa-522e-41df-852a-56d3b71103be","year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.686120Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:f06fc9018e1c8bb109db8da53101727846479f2bfe692860389869b0ab4fe214","observation_id":"81eb3287-c079-462c-bd73-4d16e5ddc414","resolution":{"observed_at":"2026-08-11T23:50:02.901595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.877378Z","title":"2dheadpose: A simple and effective annotation method for the head pose in rgb images and its dataset,","venue":null,"work_id":"54638c4f-deeb-49d3-a2f8-406db9e7c43a","year":2023},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.690677Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:3619a358174295cc089e2b5776faa6885f49f8b0a9a558e2a54b1138f8a9f0cb","observation_id":"1e460228-b367-4bc7-bc8b-a839f42771eb","resolution":{"observed_at":"2026-08-11T23:50:02.882505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.695097Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.695097Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:3e8f390dd1f3ca8095a6f121bdd3b280655c1342a861645f5b47516608188986","observation_id":"187c3fa6-7568-4419-a191-3eadea0b0acb","resolution":{"observed_at":"2026-08-11T23:50:02.695097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.700828Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.700828Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:082145d5c058b670c3dae55830dc232d8064717e80ba0a5381eb2b828ec9f7ee","observation_id":"e9f94419-6228-4186-a74f-b18772609cf1","resolution":{"observed_at":"2026-08-11T23:50:02.700828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.834292Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"bc9a5927-2346-4128-b39a-5e7f767a5cbb","year":2016},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.705533Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:8c96992e97a8da2fd0e11f86c3b212121f96ae5555cdf06117a74ddcb69e0109","observation_id":"609c4498-9b6d-432e-b857-78a935785081","resolution":{"observed_at":"2026-08-11T23:50:02.839201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:50:02.813330Z","title":"His research interests are in the field of computer vision and machine learning","venue":null,"work_id":"33dae6ef-d5a2-4916-b847-f9b566122a9b","year":1994},"citing_paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:02.710448Z"},"links":{"citing_paper":"/paper/2412.02197"},"observation_digest":"sha256:97169f96b88230596389564cbd07444c63fad7a85285a6c6830b19b24c39dd14","observation_id":"12f5252b-2563-46ee-82eb-c591ecadf995","resolution":{"observed_at":"2026-08-11T23:50:02.820433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02197","last_updated":"2026-07-13T07:11:17Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:04:44.746719Z","submitted_at":"2024-12-03T06:23:19Z","title":"Cascaded Multi-Scale Attention for Enhanced Multi-Scale Feature Extraction and Interaction with Low-Resolution Images"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2412.02197."}