{"as_of":"2026-08-11T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a07559b53a2131d97add2e7c1f8c304394e7c323fdc3a5e75a40decc01b3a7a6","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:32:15.242242Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.13066/citation-record","integrity":"/paper/2501.13066/integrity","json":"/paper/2501.13066/citation-record.json","paper":"/paper/2501.13066"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.850201Z","title":"Human action recognition from various data modalities: A review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.850201Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:da7f5950ce461946eb5ad99beb2c77285517e6f86d7ddbc0cf94f2ba0a1ab78e","observation_id":"8c15445e-ebad-4833-bdd4-10c89ad6aa10","resolution":{"observed_at":"2026-08-10T16:32:14.850201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.854842Z","title":"Human action recognition: A taxonomy-based survey, updates, and opportunities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.854842Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cf2526326e92150122ebd561fec7c8b09db0d95a8b6d0d00b750531c5969894a","observation_id":"a13fe694-d23b-4116-9ca5-49ea4f07e70b","resolution":{"observed_at":"2026-08-10T16:32:14.854842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.859098Z","title":"Graph convolutional neural network for human action recognition: A comprehensive survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.859098Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:91abe1460c5ca7ce5c23e9a44547e3da0bb0051537852d6f37a89335de174609","observation_id":"66c6d2c6-dbdc-4a47-b983-a01da0be0c8d","resolution":{"observed_at":"2026-08-10T16:32:14.859098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05700","last_updated":"2022-09-13T02:57:05Z","snapshot_observed_at":"2026-07-06T13:51:31.547167Z","submitted_at":"2022-09-13T02:57:05Z","title":"Vision Transformers for Action Recognition: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05700","snapshot_observed_at":"2026-08-10T16:32:14.863347Z","title":"Vision transformers for action recognition: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.863347Z"},"links":{"cited_paper":"/paper/2209.05700","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cb663ff432cb598df7d2792dfe1b0af3b0ac993c5af3e99fcca93815aa3714c5","observation_id":"5d5b2177-be27-4d62-8b11-cbfd377b1f9a","resolution":{"observed_at":"2026-08-10T16:32:14.863347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.867580Z","title":"A survey on video-based human action recognition: recent updates, datasets, challenges, and applications","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.867580Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:1944c1965b4da0004ea091a4c64f57cc26f1d92f2ab47839a5503d54f30ba9b2","observation_id":"479c7116-314a-476d-867f-c8a8da9c614e","resolution":{"observed_at":"2026-08-10T16:32:14.867580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.871883Z","title":"Human activity recognition: A survey.Procedia Computer Science, 155:698–703, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.871883Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:819315eeca8d77c0a60dd7cd31a11fefd53997f4d620ba7b290727963c287597","observation_id":"78ee2d7b-764f-4e8b-b57b-5780f1c3aa2c","resolution":{"observed_at":"2026-08-10T16:32:14.871883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.876446Z","title":"Human action recognition and prediction: A survey.International Journal of Computer Vision, 130(5):1366–1401, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.876446Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6109d9fb4efc095d8cc7ef55a4f9296216710be8cc40fca41694d93b7c61de8b","observation_id":"6917e805-4b0a-4006-a092-6dcf68f8d7ef","resolution":{"observed_at":"2026-08-10T16:32:14.876446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.880120Z","title":"A survey on intelligent human action recognition techniques","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.880120Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6fec0b217e46f45b3061bd00718da15973804d87febf74791055ac00a8bdb047","observation_id":"0366efc3-70c7-4718-986e-7acc0da9201c","resolution":{"observed_at":"2026-08-10T16:32:14.880120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06567","last_updated":"2020-12-11T18:54:08Z","snapshot_observed_at":"2026-07-06T10:23:36.805486Z","submitted_at":"2020-12-11T18:54:08Z","title":"A Comprehensive Study of Deep Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06567","snapshot_observed_at":"2026-08-10T16:32:14.884011Z","title":"A comprehensive study of deep video action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.884011Z"},"links":{"cited_paper":"/paper/2012.06567","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ae1fe8a5d67127decbce423845c90c65885f4f546dd49f568e246da97cb7ba40","observation_id":"05b208c8-697a-4256-8236-10283c538c9c","resolution":{"observed_at":"2026-08-10T16:32:14.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.888025Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.888025Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:02c1225bb2bb1ba78afdd6094df3eede2358e3b92c42dac280a13c3192d5ba82","observation_id":"3426b91a-7763-4b6b-9630-3119e03956e7","resolution":{"observed_at":"2026-08-10T16:32:14.888025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.891931Z","title":"Action recognition and detection by combining motion and appearance features","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.891931Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ed35365434827986ef6a235c2f5a1e6f956b9021471cff867241b21bc02a5091","observation_id":"d642e703-75a6-44f9-a482-ff18301a9083","resolution":{"observed_at":"2026-08-10T16:32:14.891931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.895511Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.895511Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:3846a656b20b4deff60c3ae3b5651eaadedc3860603d48efa39ca80130007222","observation_id":"0d6fa790-ef6f-44f3-8fbd-5496615b2d4a","resolution":{"observed_at":"2026-08-10T16:32:14.895511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.899340Z","title":"A key volume mining deep framework for action recognition","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.899340Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4dbfeb7f87f24006a69accbc893d4bcafa4c6a2da6c53836b35c5f9c9973ec1d","observation_id":"6fab0d31-d091-416e-8863-d352bd1d472d","resolution":{"observed_at":"2026-08-10T16:32:14.899340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.903390Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.903390Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:dafa27d31613ac7413220cb719120322615473193487bab523464a238c0e1e95","observation_id":"64ef1cfa-f349-4d6f-bc51-492472d50df5","resolution":{"observed_at":"2026-08-10T16:32:14.903390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.908337Z","title":"A review of human activity recognition methods","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.908337Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:f5453b525dc67ed3826fa31f7c4f0e9dadc4200dcc9fb769c5eda386fc5c809f","observation_id":"fcc737f4-3366-47dc-858b-3e38464faf03","resolution":{"observed_at":"2026-08-10T16:32:14.908337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.912839Z","title":"Analysis and predictive modeling of body language behavior in dyadic interactions from multimodal interlocutor cues","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.912839Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4929d2bc395fab4623d358645d4436e4812eae3839e2a1fa80e6aeab8f4b5dd9","observation_id":"4945c4f2-0005-4c73-b941-12311219acba","resolution":{"observed_at":"2026-08-10T16:32:14.912839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.917463Z","title":"Motion part regularization: Improving action recognition via trajectory selection","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.917463Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:c1656cc067a13a28db8fa58e76374a220eaf0d30bd541c994a257bdd525728c0","observation_id":"087be92c-e920-42e9-9081-1901c7723764","resolution":{"observed_at":"2026-08-10T16:32:14.917463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.921183Z","title":"Structured learning of human interactions in tv shows","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.921183Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:3c08a366ef57d426a0f342fcb4dc763f22be5a1cabee9c62dbeea07270610e1e","observation_id":"371113fd-e29a-4237-8e86-270b83dbe46b","resolution":{"observed_at":"2026-08-10T16:32:14.921183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.924943Z","title":"Part-based motion descriptor image for human action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.924943Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:2a49cce1d26419b9f796c31c6fb6d4190410133b532af516f9ebbeeb29add3ee","observation_id":"55a421b4-c4c2-4f98-8c52-cc2a23c1e7fe","resolution":{"observed_at":"2026-08-10T16:32:14.924943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.928608Z","title":"Don’t classify ratings of affect; rank them! IEEE transactions on affective computing, 5(3):314–326, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.928608Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:49b4b04efb17c437c3a55f48200125f372be11d412dc22d8816da409560fb68c","observation_id":"aae1d369-b02c-4fe1-aa3e-f33b916893d7","resolution":{"observed_at":"2026-08-10T16:32:14.928608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.932345Z","title":"Discriminative latent models for recognizing contextual group activities","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.932345Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:370df71528a1a70667b9ba34a32daa215fb4074f67816c19e2a1568923a4daf7","observation_id":"d30a3074-760f-459f-9ef5-51e0b0734380","resolution":{"observed_at":"2026-08-10T16:32:14.932345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.935721Z","title":"Generating Tennis Player by the Predicting Movement Using 2D Pose Estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.935721Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:95411728fe7bd8c1a05ebfe1bda64927248f562159f808839dcd4a93c567c0c3","observation_id":"b295e110-6db5-4da2-9be8-91c9f36bbe34","resolution":{"observed_at":"2026-08-10T16:32:14.935721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.939557Z","title":"Pose2trajectory: Using transformers on body pose to predict tennis player’s trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.939557Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:d2b8520363b7f8e3a9e20d8f63eae64aaa615d4602f61c868870177bacfb7742","observation_id":"1858db22-acee-4b39-88df-137e82979a03","resolution":{"observed_at":"2026-08-10T16:32:14.939557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.943416Z","title":"Deep learning based advanced spatio-temporal extraction model in medical sports rehabilitation for motion analysis and data processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.943416Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:8726891553f64062b7b76fc0eadce6d7ea4e07ec99fd6b5225bd0564281ced0c","observation_id":"fbe54013-d32b-41b5-b21a-9415c7ca8240","resolution":{"observed_at":"2026-08-10T16:32:14.943416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.947632Z","title":"Two-stream convolutional networks for action recognition in videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.947632Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5381f9a57b20a8ad4749182f3cc69939ba368250ef645d0f5c993a2b83433785","observation_id":"9b06392b-6ed6-4e36-a097-df644d024462","resolution":{"observed_at":"2026-08-10T16:32:14.947632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.951279Z","title":"Going deeper with two-stream ConvNets for action recognition in video surveillance","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.951279Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ba7fc791220c302ab8a9a669d8e3f3863a0ef84c0252afcd8eaa8f0274e3c1c1","observation_id":"a1967d74-4640-439a-8c88-f94d3f61faab","resolution":{"observed_at":"2026-08-10T16:32:14.951279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.954932Z","title":"Distinct two-stream convolutional networks for human action recognition in videos using segment-based temporal modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.954932Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9ea645472231985338e66f502777478df071accd7c421fca7937b28419d7e7e1","observation_id":"e13fc381-7186-4000-95bd-c5331c6585bc","resolution":{"observed_at":"2026-08-10T16:32:14.954932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.958793Z","title":"Action Recognition Based on Two-Stream Convolutional Networks With Long-Short-Term Spatiotemporal Features","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.958793Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:67761f6e3a3259aaa485dc9398868299145a44af1c29dc1b585180a676af0b74","observation_id":"2d4b7008-bf4b-4772-beaf-ff7b79708a4f","resolution":{"observed_at":"2026-08-10T16:32:14.958793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.962413Z","title":"Learning Long-Term Temporal Features With Deep Neural Networks for Human Action Recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.962413Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:bb8c80b815eba7fd2048cc6c9c0925e079d6aa9b8f4b9de49d2f83ae56e53f38","observation_id":"502220b6-612b-4375-96e5-67d5bb333cb4","resolution":{"observed_at":"2026-08-10T16:32:14.962413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.966026Z","title":"Human action recognition using two-stream attention based LSTM networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.966026Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:dbbfce657d2262aedbe7a540b1c960053795b5fbe91f877a7b1b7aa86033f94e","observation_id":"07f23f85-2c8a-4f6d-97ca-f57dc377b6f4","resolution":{"observed_at":"2026-08-10T16:32:14.966026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.970032Z","title":"Human Action Recognition Based on Improved Two- Stream Convolution Network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.970032Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e0b4208cb159fc4d36d83f5104938b82f80f45022ffd4f09d79e95c7b7f23fb9","observation_id":"1eba7d48-2abf-413a-825e-c011ba8ee981","resolution":{"observed_at":"2026-08-10T16:32:14.970032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.973641Z","title":"Toward Efficient Action Recognition: Principal Backpropagation for Training Two-Stream Networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.973641Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:295ff017c1e04d949efa64875dcf1f1983b11ce565cee12cdbd8705ffdcec24e","observation_id":"f0d95b6c-80d1-4a13-ae1b-3b8e371b013f","resolution":{"observed_at":"2026-08-10T16:32:14.973641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.977216Z","title":"Two-stream flow-guided convolutional attention networks for action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.977216Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:36decd78b85d91615eb9cf74879b3f5f30f03f3d3f8ceb7454eaf2b89b9d1131","observation_id":"38ab6f59-91b5-4aa2-b39f-4e0eb0b9a290","resolution":{"observed_at":"2026-08-10T16:32:14.977216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.980804Z","title":"Convolutional two-stream network fusion for video action recognition","venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.980804Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:dd2652170f248a7a0ab62471d37f4bb41c3e9a4b5288d00fc5714749ccf6935c","observation_id":"221b8831-5c80-4475-9dcb-9632412071a2","resolution":{"observed_at":"2026-08-10T16:32:14.980804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.984455Z","title":"Unsupervised motion representation enhanced network for action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.984455Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cdf05bc9206a7cc64432eac838423534f29075815e8f303f1984b9117ade6a86","observation_id":"48651237-e08c-4f71-9970-9dc77096cca3","resolution":{"observed_at":"2026-08-10T16:32:14.984455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.987883Z","title":"Two stream lstm: A deep fusion framework for human action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.987883Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fed9eb1481e6438861a780d2201922db898119127563d5759d0bb5d4e64119aa","observation_id":"96c8dd36-40ae-4a23-9a8b-421f86f56f1e","resolution":{"observed_at":"2026-08-10T16:32:14.987883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.991247Z","title":"Learning from temporal gradient for semi-supervised action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.991247Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:e9db826ea85ffdc8796045f522fba33b15e388a0eb9bc5998425645c43d85fcf","observation_id":"8285d86e-add2-405b-b861-be1ec74d7c1a","resolution":{"observed_at":"2026-08-10T16:32:14.991247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.994983Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.994983Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fe3a5026b86d8e885bbf86ad2b2ec11d7fdf7ad2b159dcccd3176bc4509330aa","observation_id":"fd5ac46e-ed3f-426d-8013-18cd7b608837","resolution":{"observed_at":"2026-08-10T16:32:14.994983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:14.999375Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:14.999375Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:8e99e7294307ea575cc15bce7952d3ca284531dbb3799b49ee3eccd5a76fcfac","observation_id":"694442f2-9be6-4136-988b-5b90f9671ce0","resolution":{"observed_at":"2026-08-10T16:32:14.999375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T16:32:15.003120Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.003120Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:1e398fb3ff1313f9679de053c60b24354a9c087f094ed413461ed4a7291dfc72","observation_id":"1265e5fe-e630-4a1e-a629-64576f35bbb3","resolution":{"observed_at":"2026-08-10T16:32:15.003120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.007504Z","title":"Hearst, Susan T Dumais, Edgar Osuna, John Platt, and Bernhard Scholkopf","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.007504Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:aa64fc6ff4463fe2f70167a7053cff523e77658371f59d4452572771b60bf49c","observation_id":"3cdbb72b-9ff7-4d06-a9dc-d272f20a5660","resolution":{"observed_at":"2026-08-10T16:32:15.007504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.011841Z","title":"A novel recurrent hybrid network for feature fusion in action recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.011841Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ee52ff3bf0489a74078c37ee6ab32725dbd8edbd8046b7ac7e187ee989856dd1","observation_id":"006914c4-5c71-4e06-98b3-0f0e8e360a98","resolution":{"observed_at":"2026-08-10T16:32:15.011841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.016042Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.016042Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5a655f8db52867398389a60252187a107739208a6173589ed3214b412eb2c6d2","observation_id":"af855d72-9b56-4d77-9fbe-bdbae898665c","resolution":{"observed_at":"2026-08-10T16:32:15.016042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.019888Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.019888Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b8b33de3b5f86add7ca125d070a898d224748ac6d3bc3de5f962bb2bb84cf527","observation_id":"cf109c2b-8d55-44b2-a1cd-8e730af1ab6b","resolution":{"observed_at":"2026-08-10T16:32:15.019888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.023638Z","title":"Fsformer: Fast-slow transformer for video action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.023638Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:23a2b0c57fd01c936882167a3f708c7fc369f30610d32c5d0120b2826bc72102","observation_id":"1c1832da-91d1-4aac-9d24-62e0fbc1b576","resolution":{"observed_at":"2026-08-10T16:32:15.023638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.027755Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.027755Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9bbbdcc2fe3fc7d494f3e543ef6a8f58d8be40c58d4a70ac3f599fbd0549ce9d","observation_id":"b3b56d9b-b085-4195-b9ab-69d6f1293329","resolution":{"observed_at":"2026-08-10T16:32:15.027755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.031865Z","title":"A novel two-stream transformer-based framework for multi-modality human action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.031865Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:19f29bf95506a23df6f5cc829bd310010afd2492f4fdf7c2e3c85f6abda42340","observation_id":"f9ec939b-9de7-45fd-8e89-bc633495c5b0","resolution":{"observed_at":"2026-08-10T16:32:15.031865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.035728Z","title":"Learning long-term temporal features with deep neural networks for human action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.035728Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4532832f010cd723abde49fd64c75699468810617602c68d99a8b1081020f6c6","observation_id":"9a08ad0e-d9bf-4859-ba8f-f158b5efead7","resolution":{"observed_at":"2026-08-10T16:32:15.035728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T16:32:15.039488Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.039488Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:8f0fb7beeb6dfe4f80cbdf875eea542f220c03e4a65cebac4a985c60c3e08008","observation_id":"6d01600f-87bd-4479-8c35-90b246ad66f7","resolution":{"observed_at":"2026-08-10T16:32:15.039488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.043853Z","title":"Neocognitron: A self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.043853Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:79147debe9bc93c22f6618fafff526d54398dbc762334f50f55098e2d86cba99","observation_id":"fb3b8262-ffe0-4af6-81b8-3f48aa417569","resolution":{"observed_at":"2026-08-10T16:32:15.043853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.048361Z","title":"3d convolutional neural networks for human action recognition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.048361Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a07ef9926132e93169d0cd3696b99e3cd44c377f46ebd20701232c059f352789","observation_id":"e80126a2-9528-4338-987a-be4295d4e8f1","resolution":{"observed_at":"2026-08-10T16:32:15.048361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.052471Z","title":"Detecting human actions in surveillance videos","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.052471Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5cb2a51ff4ec9ddab9f6d2c9fba084f8ba491b82b40129b27fb823dd61c80ee6","observation_id":"d6bce175-18bf-45b5-a7ab-cbf2b78b5b37","resolution":{"observed_at":"2026-08-10T16:32:15.052471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.056562Z","title":"Recognizing human actions: a local svm approach","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.056562Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fe50f573456b0c751f9d8f4d3fd99bf8308f393c234abd41103ccd5feb6e23f8","observation_id":"71b1a12d-9431-48f3-a9a7-d59a673b8d56","resolution":{"observed_at":"2026-08-10T16:32:15.056562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.060823Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.060823Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:070307a25eb128fed4954dcf4e11df23c2033d78727bb47fc8acf4252d49ccda","observation_id":"2f6481ab-83e8-41dc-afa9-6b58878a45f8","resolution":{"observed_at":"2026-08-10T16:32:15.060823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.064345Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.064345Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:19e8d2ba031caf8ad48efef3c71d615b4cd5d488a6881dec89c6399d57712943","observation_id":"1de64ce2-6268-48e2-8403-8a317a1d8403","resolution":{"observed_at":"2026-08-10T16:32:15.064345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.068157Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.068157Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6fe2884d8c1176ca4192e1d8446bf0cbf29e8a416a803d9d9cd4d3bb7a2353a0","observation_id":"d91cd113-c562-42fa-b6b6-4a06b64731a1","resolution":{"observed_at":"2026-08-10T16:32:15.068157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.071707Z","title":"Learning spatio-temporal representation with pseudo-3d residual networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.071707Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0277b8151c8e49c26c1940b17c8cda8cc33471d31175e577f40337fd3ac2f3c9","observation_id":"8a584ac0-34d8-4f09-8d6e-7813b3c1f0a0","resolution":{"observed_at":"2026-08-10T16:32:15.071707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.075286Z","title":"Non-local neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.075286Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0e16fef1bc98cfb65834f87407ae50390b50fa200942c12c92ed1af2c78ae31e","observation_id":"bef72ae3-ffbf-43e9-a4f3-ad767060b4d4","resolution":{"observed_at":"2026-08-10T16:32:15.075286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.079111Z","title":"Eco: Efficient convolutional network for online video understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.079111Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fcf09c8ecd19aa0d025c12148e82fc1e3ebef280ec86606d76d0b9abbba977ac","observation_id":"4baf12b3-8907-4e4a-aefc-197ee96ede2d","resolution":{"observed_at":"2026-08-10T16:32:15.079111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.082844Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.082844Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ed535c1de0c57d89bb6f227b1088af1afcd553a29c5f53bc63d8fb23a023bad4","observation_id":"579ac752-e06b-4b37-84da-a88145ce26a7","resolution":{"observed_at":"2026-08-10T16:32:15.082844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.086493Z","title":"3d deformable convolution temporal reasoning network for action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.086493Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:57a18b9f9224b8d0f23e1f873664082208938fbd3aee10e008430b8a1408e5c7","observation_id":"93f70f25-f493-47e7-8742-25661656c2eb","resolution":{"observed_at":"2026-08-10T16:32:15.086493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.090141Z","title":"The graph neural network model","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.090141Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ea22d86524153f05f771d1cd6cc1784ad7fe249014ff4a98724d039706620a02","observation_id":"ada102a0-6947-449c-9254-648448165d59","resolution":{"observed_at":"2026-08-10T16:32:15.090141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.093990Z","title":"Adaptive graph convolutional neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.093990Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:60fa354c626222476d6fc59b7a6324e38b2c0c9efae20982546fdef8f1dd89fb","observation_id":"b36196d6-8df2-4d98-8e9a-8da46f8f7e21","resolution":{"observed_at":"2026-08-10T16:32:15.093990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-07-06T05:10:16.862707Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-10T16:32:15.097624Z","title":"Semi-supervised classification with graph convolutional networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.097624Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:b43fadb30b160fdc356925abeded49ea6ac51f98e5def57a99bfb56c7090bd86","observation_id":"3d076cca-0844-4c66-9a44-ba8c3b29d3e4","resolution":{"observed_at":"2026-08-10T16:32:15.097624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-10T16:32:15.101775Z","title":"Graph attention networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.101775Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:bb5ed3b2f7c586ed6fb6bbc1c769dfe0217fb48a470dfda70ede1a12d0719048","observation_id":"0f257fa7-73fd-43c3-a176-b07371473bcf","resolution":{"observed_at":"2026-08-10T16:32:15.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00826","last_updated":"2019-02-22T19:15:54Z","snapshot_observed_at":"2026-07-06T07:05:24.565760Z","submitted_at":"2018-10-01T17:11:31Z","title":"How Powerful are Graph Neural Networks?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00826","snapshot_observed_at":"2026-08-10T16:32:15.105490Z","title":"How powerful are graph neural networks? arXiv preprint arXiv:1810.00826, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.105490Z"},"links":{"cited_paper":"/paper/1810.00826","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:97037950022ea58f8df117d8ea8a16bac30d394075e9bdfb1c4661f4edea58b8","observation_id":"aaa1ebb9-f365-4d2b-b6a6-1006ee31def1","resolution":{"observed_at":"2026-08-10T16:32:15.105490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.109337Z","title":"Graphsage-based traffic speed forecasting for segment network with sparse data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.109337Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0cd2c3183f79b8689e55e11ec3f38423db045854fc17074d7956940553a66aa8","observation_id":"765ff082-652d-49e5-9b07-c089e014e2e5","resolution":{"observed_at":"2026-08-10T16:32:15.109337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07896","last_updated":"2023-02-28T21:57:49Z","snapshot_observed_at":"2026-08-06T17:51:01.937748Z","submitted_at":"2022-09-16T12:41:43Z","title":"3D VSG: Long-term Semantic Scene Change Prediction through 3D Variable Scene Graphs","version":2},"cited_work":{"arxiv_id":"2209.07896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07896","snapshot_observed_at":"2026-08-10T16:32:16.557133Z","title":"3D VSG: Long-term Semantic Scene Change Prediction through 3D Variable Scene Graphs","venue":"cs.RO","work_id":"df67eabe-78e8-419d-abfc-8b918664030e","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.112983Z"},"links":{"cited_paper":"/paper/2209.07896","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0bee424ac337fe859f6809bf80a712877c55f4a13e15a660dfc4eff96356b038","observation_id":"c416f37d-4b20-4134-b48d-74c1d4890055","resolution":{"observed_at":"2026-08-10T16:32:16.562401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.116747Z","title":"Learning graph convolutional network for skeleton- based human action recognition by neural searching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.116747Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fc65157548f0c6c4e697665b236732d498e50df80f2dcdfc70ddf3819e448229","observation_id":"62d9fd25-fae7-42cf-a081-998fcbf7d941","resolution":{"observed_at":"2026-08-10T16:32:15.116747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.120214Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.120214Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:75cd07c61ea80bc90cba990162d8e02d832bc7c470e9d17edbaf37144eed5a85","observation_id":"3d4c2723-e0e5-4cf8-b7f2-a6058cd4ffa0","resolution":{"observed_at":"2026-08-10T16:32:15.120214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.124020Z","title":"Actional-structural graph convolu- tional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.124020Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0df50660d26d2d1db84fc4489109356c1f2b39879707adbb55e2a6fc0e910fb1","observation_id":"bff6d5b4-dd8e-4a8c-a10c-05e5d235dcb3","resolution":{"observed_at":"2026-08-10T16:32:15.124020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.127809Z","title":"Disentangling and unifying graph convolutions for skeleton-based action recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.127809Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:c8c5cf795f65dc2656dc884d4b56151c0e8613e2bcefce6d885c2e174b9cafe9","observation_id":"e7bd302f-a110-4977-8f66-852dd5470c1b","resolution":{"observed_at":"2026-08-10T16:32:15.127809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.131655Z","title":"An attention enhanced graph convolutional lstm network for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.131655Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:87a01405d9f67db6ce68a546b00bdf8ba6a1271ac0f87b9195d90506d7a5d9e1","observation_id":"248fc9ad-7359-4067-8b00-bcedc947eae5","resolution":{"observed_at":"2026-08-10T16:32:15.131655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.135274Z","title":"Skeleton-based action recognition by part-aware graph convolutional networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.135274Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4c0d144f41a4b4d9db169d1c1213849adc7da1918c82e661f8f583986f4a191d","observation_id":"8f2514ef-dc10-48cf-93c2-03e7c74b08d3","resolution":{"observed_at":"2026-08-10T16:32:15.135274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05318","last_updated":"2023-09-06T02:29:01Z","snapshot_observed_at":"2026-07-06T13:40:34.929858Z","submitted_at":"2022-08-10T12:55:56Z","title":"Generative Action Description Prompts for Skeleton-based Action Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05318","snapshot_observed_at":"2026-08-10T16:32:15.139131Z","title":"Language supervised training for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.139131Z"},"links":{"cited_paper":"/paper/2208.05318","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:97124d6482a8c1635de8ff4f1ad41e4137cb199cad6682daf6bec200dcf9234b","observation_id":"2d5de48a-0d42-4012-afa5-830a4402c6fa","resolution":{"observed_at":"2026-08-10T16:32:15.139131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12398","last_updated":"2023-05-21T08:29:16Z","snapshot_observed_at":"2026-07-06T15:30:14.400809Z","submitted_at":"2023-05-21T08:29:16Z","title":"Language Knowledge-Assisted Representation Learning for Skeleton-Based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12398","snapshot_observed_at":"2026-08-10T16:32:15.143322Z","title":"Language knowledge-assisted representation learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.143322Z"},"links":{"cited_paper":"/paper/2305.12398","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:86b668308da85ef796df1c41a33b8a8cb7dee37b350e78291628e9aba52d0714","observation_id":"ad5f850f-3562-44a8-a039-f80e1070ad4e","resolution":{"observed_at":"2026-08-10T16:32:15.143322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10741","last_updated":"2023-07-19T09:15:05Z","snapshot_observed_at":"2026-08-02T11:57:07.666801Z","submitted_at":"2022-08-23T05:27:32Z","title":"Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10741","snapshot_observed_at":"2026-08-10T16:32:15.146978Z","title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.146978Z"},"links":{"cited_paper":"/paper/2208.10741","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a7ca535a09b57a7a0eadf645634e1dabf5bd44ba596709343f180e85d8bf8ae9","observation_id":"c4b226da-5d2c-4f12-a16f-6ddeae3d9520","resolution":{"observed_at":"2026-08-10T16:32:15.146978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05895","last_updated":"2022-10-12T03:17:37Z","snapshot_observed_at":"2026-07-06T14:03:57.555580Z","submitted_at":"2022-10-12T03:17:37Z","title":"DG-STGCN: Dynamic Spatial-Temporal Modeling for Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05895","snapshot_observed_at":"2026-08-10T16:32:15.151043Z","title":"Dg-stgcn: Dynamic spatial-temporal modeling for skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.151043Z"},"links":{"cited_paper":"/paper/2210.05895","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4d04abe3669922203acfadce7838528e2c4afdd5a005bee0dce5d79b4dbb40fa","observation_id":"4f29cd74-197f-4878-b05a-508a10b31fc4","resolution":{"observed_at":"2026-08-10T16:32:15.151043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.155752Z","title":"Infogcn: Representation learning for human skeleton-based action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.155752Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:17f709f0ff4dcdc83f73d346e0154862e9db66b22e2dabc9dcc4013c88d2036f","observation_id":"a906fd36-919d-45c8-b820-a93873abf7f7","resolution":{"observed_at":"2026-08-10T16:32:15.155752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10900","last_updated":"2023-06-10T10:32:06Z","snapshot_observed_at":"2026-08-04T17:06:32.732430Z","submitted_at":"2023-01-26T02:09:16Z","title":"Graph Contrastive Learning for Skeleton-based Action Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10900","snapshot_observed_at":"2026-08-10T16:32:15.159437Z","title":"Graph contrastive learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.159437Z"},"links":{"cited_paper":"/paper/2301.10900","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:7b85f3c0eefe394acaf6df29680818b1e5beaf1bb8509cdd2c8e32d340139e32","observation_id":"e82b7616-ffe9-4188-9c8f-6b20cb44fbc4","resolution":{"observed_at":"2026-08-10T16:32:15.159437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.163569Z","title":"Spatial–temporal dynamic graph attention network for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.163569Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:7785427f4472392ffde98268d941dec74708dce77ebbea43dea025f83eab187a","observation_id":"fd96fbdc-22a7-4529-b41c-6db41bb9200e","resolution":{"observed_at":"2026-08-10T16:32:15.163569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05775","last_updated":"2022-08-11T12:12:07Z","snapshot_observed_at":"2026-08-10T14:57:58.617337Z","submitted_at":"2022-08-11T12:12:07Z","title":"PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition","version":1},"cited_work":{"arxiv_id":"2208.05775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.05775","snapshot_observed_at":"2026-08-10T16:32:16.476210Z","title":"PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition","venue":"cs.CV","work_id":"38de0a22-cf9b-4dd0-94b1-9b2af824f07e","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.168515Z"},"links":{"cited_paper":"/paper/2208.05775","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:f080d4ba165483dec6bf76005263c376b209f5ebb923cba0e999b176f0595db2","observation_id":"60f0e876-972f-4828-96c6-42529abad5ec","resolution":{"observed_at":"2026-08-10T16:32:16.480987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.173491Z","title":"Learning discriminative representations for skeleton-based action recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.173491Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:59dc47e4d576ff25af7b6550d5cfb9f5f408674c7a17f3a99631c5cc4437cd73","observation_id":"0ba568af-5747-4338-b709-975896206bf8","resolution":{"observed_at":"2026-08-10T16:32:15.173491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08599","last_updated":"2022-09-13T06:25:23Z","snapshot_observed_at":"2026-07-06T13:42:57.057471Z","submitted_at":"2022-08-18T02:34:46Z","title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","version":2},"cited_work":{"arxiv_id":"2208.08599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.08599","snapshot_observed_at":"2026-08-10T16:32:16.458437Z","title":"Spatial Temporal Graph Attention Network for Skeleton-Based Action Recognition","venue":"cs.CV","work_id":"ccdeaccc-d67c-4d6c-bd54-1629c1dc8a1f","year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.177860Z"},"links":{"cited_paper":"/paper/2208.08599","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:4f02220ab9d523ad55c09ff12c49a47dec26be58272cc6b82d2164182a032ec7","observation_id":"0e416f82-b135-43ab-8a6d-51e06889471b","resolution":{"observed_at":"2026-08-10T16:32:16.462788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15936","last_updated":"2022-08-08T12:41:25Z","snapshot_observed_at":"2026-08-07T22:21:09.987686Z","submitted_at":"2022-05-31T16:28:30Z","title":"Skeleton-based Action Recognition via Temporal-Channel Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15936","snapshot_observed_at":"2026-08-10T16:32:15.181938Z","title":"Skeleton-based action recognition via temporal-channel aggregation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.181938Z"},"links":{"cited_paper":"/paper/2205.15936","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:876cbe59ce414a3c53b6c595acf6432f198bee3ebb10ba41341f14486f8469b6","observation_id":"2398489a-4e61-475e-be77-ec8cff098111","resolution":{"observed_at":"2026-08-10T16:32:15.181938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.186014Z","title":"Temporal decoupling graph convolutional network for skeleton-based gesture recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.186014Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fdae57ce8c38d24a4371ac3c109f6398a954ebbd784fefac3562dfcde6d09913","observation_id":"d0d1a087-645a-4c7f-a5c4-62e7530dfb5b","resolution":{"observed_at":"2026-08-10T16:32:15.186014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.190126Z","title":"Mict: Mixed 3d/2d convolutional tube for human action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.190126Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:edff5cc5325d2a1bb809ef72faa91455d4d12fd4159417f6d2a003b07de6d708","observation_id":"e6831011-386b-4b99-a6fd-42e69dc200fc","resolution":{"observed_at":"2026-08-10T16:32:15.190126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.194144Z","title":"Stacked spatio-temporal graph convolutional networks for action segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.194144Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:1e798f89253f4758e5f6dbc314a4763029be8d8cdca32b96b49e1292ba4b0c54","observation_id":"d39f7466-2cf2-459e-8c9d-c8d167a82202","resolution":{"observed_at":"2026-08-10T16:32:15.194144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.197892Z","title":"Dynamic multiscale graph neural networks for 3d skeleton based human motion prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.197892Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:2846eae57e7da2eff9234f66fdbccffd89a3e678c4172b3f1c83a13cde813372","observation_id":"5b847834-a033-4b6b-ba05-f1e3102e32b7","resolution":{"observed_at":"2026-08-10T16:32:15.197892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.201721Z","title":"Two-stream adaptive graph convolutional networks for skeleton-based action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.201721Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:971990a94432dc2fa7dc6c256750edcfc09386188228b9e788fcc2f6648827d0","observation_id":"a547197a-5645-47ab-8e96-2e65be51661e","resolution":{"observed_at":"2026-08-10T16:32:15.201721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.205236Z","title":"Edge and node graph convolutional neural network for human action recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.205236Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:1e97b9aba52572e78a5b668351133dcac3937d6c9a81442ac963e207db5695a1","observation_id":"112a946d-30c1-4441-9d57-ea42cbf36a87","resolution":{"observed_at":"2026-08-10T16:32:15.205236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.209228Z","title":"Improving action recognition with the graph- neural-network-based interaction reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.209228Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:9bdbfe2ab60d5b60ff5d8771ba36745fd30d196d1350bec54681686cd62f949c","observation_id":"11e0ebf2-7481-47ae-b79f-d8ed655c63a8","resolution":{"observed_at":"2026-08-10T16:32:15.209228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.213250Z","title":"Skeleton-based action recognition with directed graph neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.213250Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:6c629b42f6b64657bd369d143b17da1386acdfce190fa8073b4d6e93a821299a","observation_id":"fd505abf-befb-4710-b842-e342ad9d22a8","resolution":{"observed_at":"2026-08-10T16:32:15.213250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.217050Z","title":"Graph interaction networks for relation transfer in human activity videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.217050Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:0ee81dea40abaef899d1d9e657e8cb2e45e9ceb52dce4fa938653b9cdcb6c9a4","observation_id":"cca27e29-ae2f-467e-8ccd-c08b6449250e","resolution":{"observed_at":"2026-08-10T16:32:15.217050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.220946Z","title":"I know the relationships: Zero-shot action recognition via two-stream graph convolutional networks and knowledge graphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.220946Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:a709d131b285b695dd51c41a5de7b00fd89247f459e0e9679febbdac8d501da5","observation_id":"7365904b-3a40-4a3e-867f-8dbbdaa28e33","resolution":{"observed_at":"2026-08-10T16:32:15.220946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.224784Z","title":"Learning to model relationships for zero-shot video classifica- tion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.224784Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:ef316f2bfa340d5f3a40edeaf191e149c1e4ff5d5a5d0044c151ae6ed07ed4d5","observation_id":"10b29226-e65d-4d42-89ab-0fe8adb6b05f","resolution":{"observed_at":"2026-08-10T16:32:15.224784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.228720Z","title":"Deep progressive reinforcement learning for skeleton-based action recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.228720Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:fa2aeb8f1301aa0bf0077a018c25bc9a914c8f412d81800f1c7811e2b1cd05e1","observation_id":"decfecb7-5def-4ccc-b6a8-1bd131ff9d50","resolution":{"observed_at":"2026-08-10T16:32:15.228720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.234669Z","title":"Skeleton-based action recognition using multi-scale and multi-stream improved graph convolutional network","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.234669Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:051865168c931fd630b8c064336e93162b2c683a78f45e546c5ad8491a936f7b","observation_id":"cfc32e2d-9849-40cf-a73e-d4a04198a711","resolution":{"observed_at":"2026-08-10T16:32:15.234669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.238567Z","title":"Aggarwal and Q","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.238567Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:cf2dd5e1816d3eca66c2fb8037b4dbe00496c3d09c4247b68b8ac811524773a8","observation_id":"852b8c3c-2dad-490f-a8a6-99e6427fc1e5","resolution":{"observed_at":"2026-08-10T16:32:15.238567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:32:15.242242Z","title":"Horn and Brian G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.242242Z"},"links":{"citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:13a9c2cc4fb31ff3917947d8208781e7b3fafae248e49a0c86560fe7b50f1fbb","observation_id":"dfc7c30e-c028-4143-a64e-95bc1799f503","resolution":{"observed_at":"2026-08-10T16:32:15.242242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 0 inbound Pith citation observations for arXiv:2501.13066."}