{"as_of":"2026-08-11T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1388c5ec452685ac88ef3d1e220c99de5fbe8584e600eab23c391bcf2424c147","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:44:42.468224Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00935/citation-record","integrity":"/paper/2501.00935/integrity","json":"/paper/2501.00935/citation-record.json","paper":"/paper/2501.00935"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.894462Z","title":"Exploiting recurrent neural networks and leap motion controller for the recognition of sign language and semaphoric hand gestures,","venue":null,"work_id":"ea404c39-dd15-48f0-907a-b942ad57bea1","year":2018},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.338049Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:adeb2cdab095ef9ffd7c25a47c02a3f093167277bda2ff479fc060b657a7d863","observation_id":"01016162-a430-49d0-a8cc-0666398c37ef","resolution":{"observed_at":"2026-08-10T22:44:42.898970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.880953Z","title":"Attention in convolutional LSTM for gesture recognition,","venue":null,"work_id":"508e69d9-d3dc-472d-b30b-ff15f8ab7218","year":2018},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.343199Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:6c2566500fcf08675e40de72d05ad1676c21b40889484e66a53be0c00adae6e8","observation_id":"8ea96a26-a8af-4e17-81f0-99f4260994e0","resolution":{"observed_at":"2026-08-10T22:44:42.886256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.868540Z","title":"Attention-based gated recurrent unit for gesture recognition,","venue":null,"work_id":"f6f487c0-ea27-4d0e-865e-d2122ced3806","year":2020},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.347751Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:5899e4594ea37682666cc37bf5aae27214dfbc322a39a20651ea7f59e6d3a16c","observation_id":"d7ec6c33-debc-4041-a47a-d7518ab44d3b","resolution":{"observed_at":"2026-08-10T22:44:42.873000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.855603Z","title":"Online detection and classification of dynamic hand gestures with recurrent 3D convolutional neural network,","venue":null,"work_id":"0292913a-45d7-4bda-8d60-bc2391095c55","year":2016},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.352633Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:4f56aa6ca33020233955a7a49ecdbcc211e16dd27bb735eace8bf4f9ebfe272b","observation_id":"17dd7c9e-576d-4da0-9294-a81fa22911ba","resolution":{"observed_at":"2026-08-10T22:44:42.860177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.843952Z","title":"Attention is all you need,","venue":null,"work_id":"3ca8d85a-c12b-45d3-a537-007e25d93bee","year":2017},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.357398Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:0f91b2283af4124ef691ab2f60b58db5020453bdf6eaab261d202ff3dce3121a","observation_id":"22bf9b31-3bf1-4c4d-babb-d9c810005100","resolution":{"observed_at":"2026-08-10T22:44:42.848104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.830952Z","title":"An image is worth 16 ×16 words: Transformers for image recognition at scale,","venue":null,"work_id":"0fe02913-a38e-4621-b657-b8d0c54bcef6","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.362231Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:bbdaf7655f5921153735c621e432ccf869820fc1b7704fac2ee0d38b92778a8b","observation_id":"bfbb28b8-bd59-4ae7-8b28-33d1cd3b9961","resolution":{"observed_at":"2026-08-10T22:44:42.835575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-10T22:44:42.366245Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.366245Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:815c6d697555e222aa83feaaf797d94d6c4f1499a6cb3de42e37773bf5245c18","observation_id":"7164164d-1986-427c-98b1-cab1b9334db1","resolution":{"observed_at":"2026-08-10T22:44:42.366245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00719","last_updated":"2021-08-17T11:17:47Z","snapshot_observed_at":"2026-08-11T06:47:27.924892Z","submitted_at":"2021-02-01T09:29:10Z","title":"Video Transformer Network","version":3},"cited_work":{"arxiv_id":"2102.00719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.00719","snapshot_observed_at":"2026-08-10T22:44:42.575940Z","title":"Video Transformer Network","venue":"cs.CV","work_id":"c576bae2-e564-4794-908b-3422767c56a6","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.370070Z"},"links":{"cited_paper":"/paper/2102.00719","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:a4333aa3b6a39c34b7ead8f75af343f55862387cbc1b06f611ec4e0b3a66245d","observation_id":"422b1919-b928-445e-a91f-9bc6b623814f","resolution":{"observed_at":"2026-08-10T22:44:42.580679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14899","last_updated":"2021-08-22T18:53:59Z","snapshot_observed_at":"2026-08-11T09:30:46.702314Z","submitted_at":"2021-03-27T13:03:17Z","title":"CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14899","snapshot_observed_at":"2026-08-10T22:44:42.374513Z","title":"Crossvit: Cross attention multi- scale vision transformer for image classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.374513Z"},"links":{"cited_paper":"/paper/2103.14899","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:16d84d452b8bfec3055a2a31c8aacfb097685e3ca4d5e916a3a88465bc674792","observation_id":"cd7e5ee1-2f35-433d-ab50-f22063b446a8","resolution":{"observed_at":"2026-08-10T22:44:42.374513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-08-10T18:08:12.282553Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-10T22:44:42.379339Z","title":"Multiscale vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.379339Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:a0bd8a98259fc8ce6cbe7be0873ffb3f59cf270523f20e757d179f86b93466cb","observation_id":"3f4d0af7-febb-42fc-8b62-73b8ddfc7ac5","resolution":{"observed_at":"2026-08-10T22:44:42.379339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01526","last_updated":"2022-03-30T17:56:37Z","snapshot_observed_at":"2026-08-10T16:05:12.638929Z","submitted_at":"2021-12-02T18:59:57Z","title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01526","snapshot_observed_at":"2026-08-10T22:44:42.384108Z","title":"Improved multiscale vision transformers for classification and detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.384108Z"},"links":{"cited_paper":"/paper/2112.01526","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:bd4ccfb2b0c71cd545c8baa9857b57176a5c0b7b876947dde9154fd60e5d9bc4","observation_id":"30f1d953-db89-4e5d-841f-44dda78cb4fe","resolution":{"observed_at":"2026-08-10T22:44:42.384108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.818566Z","title":"A Transformer-based network for dynamic hand gesture recognition,","venue":null,"work_id":"ff0a5951-ba79-4b86-a33c-be2dbdb662c3","year":2020},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.388888Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:e73d94502baa2fef6fdf08193c6b3802930e891733dd34bf55303588ca99142b","observation_id":"68c2f107-f4f3-42a9-9fb1-678ec968b632","resolution":{"observed_at":"2026-08-10T22:44:42.822679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.806663Z","title":"Incorporating relative position information in transformer-based sign language recognition and translation,","venue":null,"work_id":"67f7b45f-31e7-41fe-8838-5b8aa15c53d4","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.393489Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:2c2c4b56ac1a5450baf9a6b66b89d228196d0653549950ac3f86ff6c110b949e","observation_id":"2cd495e4-8898-44c3-a2a9-c69fba8f1568","resolution":{"observed_at":"2026-08-10T22:44:42.811127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.795389Z","title":"Searching multi-rate and multi-modal temporal enhanced networks for gesture recognition,","venue":null,"work_id":"940f1cd8-0e3d-46f4-9493-b85a256a7e2b","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.397778Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:af1c699b5dde8dfa773691c6dba9db1969663d6abab1571f9a33fa79a2fc0bf3","observation_id":"2790838a-6db1-4ad2-8fb6-9e6bbf06c04b","resolution":{"observed_at":"2026-08-10T22:44:42.799286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.782965Z","title":"TMMF: Temporal Multi-Modal Fusion for single-stage continuous gesture recog- nition,","venue":null,"work_id":"695de56d-7545-4538-acda-0a144531a728","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.403181Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:2c9ab20b6a3795fc33550c500a2112a8bb7160a92daa508d5ea401a1a578b00d","observation_id":"68c51c78-318f-4110-a498-055d440cd0c6","resolution":{"observed_at":"2026-08-10T22:44:42.787116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.770037Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"42366c45-d66e-4e5b-8978-db87e85e2515","year":2009},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.408169Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:d1b05fdbc2afb0e1b040e8099ef12186826d4fdadc09218d499f2fa459212879","observation_id":"504e1112-2760-4982-ac4f-02749289d282","resolution":{"observed_at":"2026-08-10T22:44:42.774288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2199","last_updated":"2014-11-12T20:48:33Z","snapshot_observed_at":"2026-08-02T14:08:16.661387Z","submitted_at":"2014-06-09T14:44:14Z","title":"Two-Stream Convolutional Networks for Action Recognition in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2199","snapshot_observed_at":"2026-08-10T22:44:42.412647Z","title":"Two-stream convolutional networks for action recognition in videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.412647Z"},"links":{"cited_paper":"/paper/1406.2199","citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:65b18beca9d11d33a5223f35342f30d5b92dfb9fe7e1d3e7aaeaea161b9f4ed5","observation_id":"8366ec62-9116-4e03-88a6-6ea0424ff9a6","resolution":{"observed_at":"2026-08-10T22:44:42.412647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.756695Z","title":"A robust and efficient video representation for action recognition,","venue":null,"work_id":"8b8b5acb-9eb2-4bd2-84d8-32a337b8cff7","year":2016},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.417345Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:4e22d840dd05039a7ad4a84246bce09581ba8feb1f573532b5f54bd9475adf68","observation_id":"733ce869-316a-48c3-9fb7-6d46535b37ee","resolution":{"observed_at":"2026-08-10T22:44:42.761668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.743407Z","title":"Res3atn-deep 3D residual attention network for hand gesture recognition in videos,","venue":null,"work_id":"ff516619-31c2-4e10-b560-480443e7166e","year":2019},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.421408Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:87fff2085e4f4830f3273b11660b75be44493323dae74e1d2f1a73849a7158ef","observation_id":"24fd4795-6661-4413-b6f8-35b5d5c504b8","resolution":{"observed_at":"2026-08-10T22:44:42.747742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.730339Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"b3e07f04-25b1-49bf-9c93-f148d273309b","year":2015},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.425533Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:1d4216c379a59e13e7e3ffc2b417fa2d53434e7049585ed67482ec833fac38c8","observation_id":"88a65e5d-42fb-488a-a23c-6af0e4a9156f","resolution":{"observed_at":"2026-08-10T22:44:42.734802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.716062Z","title":"Multi-task and multi-modal learning for RGB dynamic gesture recognition,","venue":null,"work_id":"77d85887-063a-4041-a3ca-a2d76d47439e","year":2021},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.430604Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:c3c834df0ab0f6839085193dd7866f895bfa6f6af45f02c15bc67ccb7108f121","observation_id":"be70412e-52b7-462c-969d-c291b3adf076","resolution":{"observed_at":"2026-08-10T22:44:42.721546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.702261Z","title":"Making convolutional networks recurrent for visual sequence learning,","venue":null,"work_id":"87104d73-f304-46f7-9dca-1b4e542b0926","year":2018},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.435169Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:43a4d281ce9a69a93cdf42d02b91f83fd672e7347911b362d5432ae5f36ac08f","observation_id":"0bed9be7-8c61-4583-b2b8-247cc5b08c87","resolution":{"observed_at":"2026-08-10T22:44:42.707408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.689116Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset,","venue":null,"work_id":"d20a610b-596a-4cc1-84f6-33baff329a16","year":2017},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.439168Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:a583a46f8c3960ac127d9c2d01a0deabfd9e0ca643bda7908d7c8ffb958b8750","observation_id":"8304e128-bf4a-4640-8d07-8373307a7945","resolution":{"observed_at":"2026-08-10T22:44:42.693721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.676379Z","title":"Real-time hand ges- ture detection and classification using convolutional neural networks,","venue":null,"work_id":"4fc00756-4864-46d2-ba73-8d66f22edf6f","year":2019},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.444421Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:df11578af5370ed6b44eaccb1ae090ee412f78c748e338437c383ee65fc5253c","observation_id":"0bc6a973-ed18-4152-88e0-7b23947773c7","resolution":{"observed_at":"2026-08-10T22:44:42.680593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.662523Z","title":"Improving the perfor- mance of unimodal dynamic hand-gesture recognition with multimodal training,","venue":null,"work_id":"e491850b-35f5-4a4a-b860-d8e5d3b8aa35","year":2019},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.448724Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:8ea5cb0922777634ff3badea42ed8048cfce28c6c3a16b1108f000b7034267d5","observation_id":"f502ad87-70f5-4758-9f93-0e6ab8316c40","resolution":{"observed_at":"2026-08-10T22:44:42.667176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.649601Z","title":"Super normal vector for activity recognition using depth sequences,","venue":null,"work_id":"fbbfd0c6-06d0-434a-a78c-1d8649506029","year":2014},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.452677Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:5014f88e861f9e053df155fd404e27fa02e899a9b7349eb4cdd530cb6b4e698c","observation_id":"62664a0e-456d-4296-b70d-c4380f177282","resolution":{"observed_at":"2026-08-10T22:44:42.654082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.628126Z","title":"Motion fused frames: Data level fusion strategy for hand gesture recognition,","venue":null,"work_id":"fa651d85-9a7e-4a7b-bd8b-8fef2d16f9d9","year":2018},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.456529Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:238e5046da84c9947532b76d95e312a72bc6606787c310fe2f6e8716e2a0a12c","observation_id":"5a8e84e2-f1d3-4ed4-b213-bd0204b02d81","resolution":{"observed_at":"2026-08-10T22:44:42.632428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.615522Z","title":"Dynamic hand gesture recognition based on short-term sampling neural networks,","venue":null,"work_id":"d172bea2-c110-4f0b-bbe4-121378268edf","year":2020},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.460704Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:6b7cc19d6304b300163bdf9d09b4e485e9a392c69e35478fb75664b9ffb76864","observation_id":"21cce0f5-8e5b-4067-af29-96b6fb0330bd","resolution":{"observed_at":"2026-08-10T22:44:42.619923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.602381Z","title":"Hand gestures for the human-car interaction: The Briareo dataset,","venue":null,"work_id":"6700f9db-c882-466c-8979-a440f00d920b","year":2019},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.464869Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:90df6f9952e49754afce2f876e69f5e876379cb853ae65f10f67472f95e6b0a3","observation_id":"6b435dcb-e792-435c-828e-c5a8e9bb572e","resolution":{"observed_at":"2026-08-10T22:44:42.606536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/informatics7030031","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:42.497712Z","title":"Multimodal hand gesture classification for the human–car interaction,","venue":null,"work_id":"a3226c68-9ee9-4bf9-955d-09df0e6a3cdf","year":2020},"citing_paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:42.468224Z"},"links":{"citing_paper":"/paper/2501.00935"},"observation_digest":"sha256:4ca2ad4bcc40e26ad6f86277c19489e6c69834ce71e420585be537635709b133","observation_id":"c38f8d55-585f-4dc1-8916-f6425ccb2cf9","resolution":{"observed_at":"2026-08-10T22:44:42.505375Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00935","last_updated":"2025-01-01T19:26:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T18:30:25.246196Z","submitted_at":"2025-01-01T19:26:32Z","title":"Multiscaled Multi-Head Attention-based Video Transformer Network for Hand Gesture Recognition"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.00935."}