{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78ce078baecc204b0ce6e9798693883708256400273cfe6e4bbe7803f01765c2","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:47:34.476382Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20795/citation-record","integrity":"/paper/2506.20795/integrity","json":"/paper/2506.20795/citation-record.json","paper":"/paper/2506.20795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.704259Z","title":"Tracking body and hands for gesture recognition: NATOPS aircraft handling signals database,","venue":null,"work_id":"1777cca8-43a1-4695-bf66-3ca8a9ab0561","year":2011},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.116119Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1b3a46673e88117ed42d1ba64a6e4d81b9513806ff5d8b057a5dbb4294a2365b","observation_id":"0977bb5c-e24f-49fa-9e11-2e0c24e2999a","resolution":{"observed_at":"2026-08-06T22:47:35.709166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.671574Z","title":"Visual recognition of traffic police gestures with convo- lutional pose machine and handcrafted features,","venue":null,"work_id":"136e692b-1383-406b-b6eb-b67c16fd33fd","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.123214Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f960cadb3e86514f602d8750bb822a91f7eb794280ac19b29352f51393c90af9","observation_id":"66f33768-a71e-4d02-a2d6-70156ab532f4","resolution":{"observed_at":"2026-08-06T22:47:35.688198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.645554Z","title":"Chinese traffic police gesture recognition based on graph convolutional network in natural scene,","venue":null,"work_id":"3b3ef916-a57c-4b4f-8826-b5915e664832","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.128641Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:16b7e0dc6d2418ba1fd171ea4ef43bc7a5ab45e8ff5976ceae5f866f676eaaa9","observation_id":"ae249163-6d36-47fc-b4bf-441cd4781d13","resolution":{"observed_at":"2026-08-06T22:47:35.655428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.614241Z","title":"Traffic control gesture recognition for au- tonomous vehicles,","venue":null,"work_id":"ce2ba459-a307-441b-a344-9df910e87a59","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.134162Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:70ea3c28a7144aa559717a42ee28f25c7bdf3f4861830839ffeaa1f64ac79aaf","observation_id":"158512e3-8fc1-4d27-ac7b-1257dbec263a","resolution":{"observed_at":"2026-08-06T22:47:35.628544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.589057Z","title":"Learning deep and compact models for gesture recognition,","venue":null,"work_id":"b7fda9de-3e2d-4303-b541-1b9d6a955b94","year":2017},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.139393Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a76d86b9cb6a5f45c84f7ae684f38667db81fab061113c810594894afb44c370","observation_id":"31fc76d5-79b9-4df4-aa7e-d8b86a212ffa","resolution":{"observed_at":"2026-08-06T22:47:35.598438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.562362Z","title":"HGR-ViT: Hand gesture recognition with vision transformer,","venue":null,"work_id":"6bccb682-e825-4d85-ae0e-b3763a57c176","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.145053Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:916cc5986d94dbae7af0cac4280dfc60b89e45647a460394c9cac5df3544408d","observation_id":"4fa5628a-f2c3-40fa-8f26-33cc845ebed0","resolution":{"observed_at":"2026-08-06T22:47:35.572660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.540526Z","title":"A transformer-based network for dynamic hand gesture recognition,","venue":null,"work_id":"f806a6fb-3d59-4a79-8ef7-b37bbded72a5","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.150425Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:bed7c256c4db45d9ef052800d485b4a179d544a5cdf27b2c5c053b207494cbef","observation_id":"bbe65676-4035-4905-be46-0d598d564cd7","resolution":{"observed_at":"2026-08-06T22:47:35.549144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.521214Z","title":"Dynamic gesture recognition based on LSTM-CNN,","venue":null,"work_id":"45abb168-a174-46dc-beb2-89698a196641","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.156161Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a896ddf48f91bd848859365c3d696784e27ac2e5edab5c541e79d264769a3870","observation_id":"f9da4b82-c700-4d74-a0c3-11ea6ee0adcf","resolution":{"observed_at":"2026-08-06T22:47:35.528268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.500946Z","title":"Body gesture recognition to control a social mobile robot,","venue":null,"work_id":"6cee9104-bd27-4853-aa99-658ddb77a528","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.160933Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:56850331f95a5b869108a5bd17177eed3e9afdf98ee8c4108da778ad62b32bd0","observation_id":"6ee1551e-9677-4c1f-829f-251deccfa48f","resolution":{"observed_at":"2026-08-06T22:47:35.508697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.481618Z","title":"A fast-response dynamic-static parallel attention GCN network for body–hand gesture recognition in HRI,","venue":null,"work_id":"f3838ed9-be7f-42ed-9533-228fbe4ad7a4","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.165582Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:ce1f405cf1beb753417d61639f2a7b3ee08720e6c083d14027c1a37b003f8bf8","observation_id":"33a5e70e-475b-4cd6-996c-d8b2ce51e5c7","resolution":{"observed_at":"2026-08-06T22:47:35.487709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.464478Z","title":"MeTRAbs: Metric-scale truncation-robust heatmaps for absolute 3D human pose estimation,","venue":null,"work_id":"d2a520ef-d27f-41c9-a1eb-3f398cf5ec2b","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.171013Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:da0b35b13eb3254991c75fe6239e78e5d400ffa571342b3bf12bdf3461b55d76","observation_id":"1496d3c6-eb62-4f28-bf2e-119cc4707a0d","resolution":{"observed_at":"2026-08-06T22:47:35.469933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.429688Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":"aaedfa5d-9b34-4669-9181-fafc7e52a866","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.180532Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1d7790afe74eab9e7eb553119938d092760ab3bc1810a21a884c6788a1ad65e7","observation_id":"5215498f-55ee-45c6-8bc8-0ca073f1558f","resolution":{"observed_at":"2026-08-06T22:47:35.434782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.413667Z","title":"The Gemini 2.0 model family,","venue":null,"work_id":"9dd1b348-03f7-4cc8-9354-ffdebdf722c2","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.185998Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:2a5bcd57276a39037e3bbff8ad579ee96359f5705c3951ad3babc5eabfdbd47a","observation_id":"d09ba8f9-2503-455c-8ca7-0be1b883778a","resolution":{"observed_at":"2026-08-06T22:47:35.418357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.397100Z","title":"GPT-4: OpenAI’s language model,","venue":null,"work_id":"8f886cf2-da33-4110-9dca-28b213ed4d91","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.191173Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a4e7920581d1d712002a87561cd852bb81e3123803da6c9663451d03e8de7d8a","observation_id":"0eb3cd97-1fd5-43d9-a818-17d344f602c9","resolution":{"observed_at":"2026-08-06T22:47:35.401586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-07-06T18:10:37.836239Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T22:47:34.195792Z","title":"Foundation models for video understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.195792Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1b1144919618475dea2fcb17bdfcd74b312ff44592a11dc5955b1a701be2f4c3","observation_id":"d9c5ec05-8374-4726-822d-161b0b5cbc8d","resolution":{"observed_at":"2026-08-06T22:47:34.195792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.381865Z","title":"VideoGLUE: Video general understanding eval- uation of foundation models,","venue":null,"work_id":"23ddf118-8d8b-4ba4-b070-584ff635bb3a","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.200607Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:288da899683f1ebbc2d7a6b38b9e7449ccb594f5a60be739ad68f20792bb1c47","observation_id":"347b33eb-322d-46d9-bd16-228401e838c0","resolution":{"observed_at":"2026-08-06T22:47:35.386609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.366393Z","title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":"a1190d99-f89d-4260-8548-c3cddb25d256","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.205567Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:d9e5492d91e71d734b73a30db4287295a27e3cecb672c11ae1c7d07b5989247d","observation_id":"dcb18920-72e7-4d01-8267-634b9f231402","resolution":{"observed_at":"2026-08-06T22:47:35.371377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:47:34.210136Z","title":"Gemini: A family of highly capable multimodal mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.210136Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:e1f7022873083fc818167c4f972ba3151061c33e2981b248894340d585d14595","observation_id":"b74372b2-9cdd-4198-865b-03ea26734a8c","resolution":{"observed_at":"2026-08-06T22:47:34.210136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.351637Z","title":"Gesture recognition: A survey,","venue":null,"work_id":"b96abd3b-1e53-4a7e-8543-7dcc59f27ab3","year":2007},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.214957Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:80f5d7fc8db1029ab6843a8c1a1585ac33d5d6563abe7d51e3bb6c6c0f4fcc3a","observation_id":"86d67e9c-5883-440f-b3bc-5ecac193994d","resolution":{"observed_at":"2026-08-06T22:47:35.356152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.336985Z","title":"Survey on hand gesture recognition from visual input,","venue":null,"work_id":"53d2ef7b-9981-4ca9-beb8-f932df170523","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.220089Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:72c81cb55b262588aba71b2d43c524d35d71e017ac15ec6e09ffc1bf7b39a1ed","observation_id":"eacd6685-8483-4597-99fe-4a68966568a0","resolution":{"observed_at":"2026-08-06T22:47:35.341443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.321979Z","title":"Computer vision-based hand gesture recognition for human-robot interaction: A review,","venue":null,"work_id":"db94d4bc-fea9-4294-a781-d44791f70ced","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.224610Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:1a8143f23e7b5c84326d66f720ef017b8bd04ae24a697373debf3dd05107edc3","observation_id":"7e2911a4-eaf8-45e4-9f88-22540789d3a5","resolution":{"observed_at":"2026-08-06T22:47:35.326795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.306660Z","title":"Robust dynamic gesture recognition at ultra-long distances,","venue":null,"work_id":"0a8c742b-e965-400a-ad76-bae60200728a","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.230419Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:614f6258856cf527d38b6e5f70535786c2e42adc83b97ecd3b57ca767b6bb694","observation_id":"8f661806-8e1b-40ac-b7b0-c3bfbba05190","resolution":{"observed_at":"2026-08-06T22:47:35.311370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.289825Z","title":"UA V-GESTURE: A dataset for UA V control and gesture recognition,","venue":null,"work_id":"3aaf8b7b-e9fa-4493-a76f-539fc86220e2","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.236928Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:ae1cf252d458d4536ef37c249918ba2f0f36a34f9a0682c213d8d7fc150c30b6","observation_id":"664f1231-e18b-4ac9-9e4b-c0c4d8f3fd73","resolution":{"observed_at":"2026-08-06T22:47:35.295687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.273947Z","title":"An overview of hand gesture languages for autonomous UA V handling,","venue":null,"work_id":"0efdcc2b-ec73-4720-9ebd-91ff86df40f3","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.241668Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:06210959e0694e4fd49c1eeb1b25adcfb6a891c492b0c8b5eded9aa8152a5418","observation_id":"be199989-a71c-4b23-96de-2199859f8480","resolution":{"observed_at":"2026-08-06T22:47:35.278652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.258711Z","title":"Synthetic-to-real domain adaptation for action recognition: A dataset and baseline performances,","venue":null,"work_id":"1d484b9a-9fe9-4e28-b2c8-67df56b24937","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.246871Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:eb268dcbc79aecd81c559c8b3745fadfcae37e16ba1a63e05786eec3341d880e","observation_id":"b33a1ad4-2546-4a8b-b705-be44c9e42d34","resolution":{"observed_at":"2026-08-06T22:47:35.263562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.243371Z","title":"Real-time multi-modal hu- man–robot collaboration using gestures and speech,","venue":null,"work_id":"024fb0e2-ca4d-4280-8c0a-3af39268e9ea","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.251598Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:cdf953830a098382e6b9899f8e971e2149f5856f43b6091f563ec94fa2d29b8d","observation_id":"c1ffb636-c25d-4916-9f0b-a729c0afb206","resolution":{"observed_at":"2026-08-06T22:47:35.248672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.228229Z","title":"Vision-based hand gesture recognition for human- robot collaboration: A survey,","venue":null,"work_id":"648b4ded-58f6-4aca-ba9d-1f4b7eedf077","year":2019},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.257266Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:951ef397eab726fe4761921d27b3bb15fae3e3cc3bf42adf8422138de6d3898d","observation_id":"9a615138-cec4-444e-bba4-f4eada77bb21","resolution":{"observed_at":"2026-08-06T22:47:35.233176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.213417Z","title":"A human-centered approach to robot gesture based communication within collaborative working processes,","venue":null,"work_id":"297f15f1-6fad-45a8-883f-4bc16cd749df","year":2011},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.262973Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f49244444a5f07eb76e40b23d8e418c84837fded4154284834c9cd060c5cb3c7","observation_id":"450207d8-ac34-4a1d-9a40-1e4d1d70da84","resolution":{"observed_at":"2026-08-06T22:47:35.217984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.198413Z","title":"FollowMe: Person following and gesture recognition with a quadrocopter,","venue":null,"work_id":"cca1879a-acdf-44ee-a82a-cec876b701e9","year":2013},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.268038Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a293487b03b9427aafea81d9492c7ae77a7c17d43790d93016dd0d1043f1028b","observation_id":"9b76d27a-6b23-46b4-b707-bdd892de1dfd","resolution":{"observed_at":"2026-08-06T22:47:35.203076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.183412Z","title":"Innovative collabora- tive method for interaction between a human operator and robotic manipulator using pointing gestures,","venue":null,"work_id":"ccf42819-022c-43e7-a88e-366a667a803d","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.273173Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:3a8b6e7ef2fb65b5df4038a6b8836a819842db1d264ea36bbf90785f70585fdf","observation_id":"484d3b1c-fe4c-4f57-90e3-92b0d2c43b0d","resolution":{"observed_at":"2026-08-06T22:47:35.188228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.167446Z","title":"Gesture recognition for human-robot collab- oration: A review,","venue":null,"work_id":"1d3c46f9-0c2f-42d4-b7d0-22c89e1cd5c6","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.278338Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:642a257a682372efa4826e3311c301b7fa8b560000cb0573cba500d223e30171","observation_id":"d94bc3d9-533d-4b0a-b54d-c82810c87d07","resolution":{"observed_at":"2026-08-06T22:47:35.172444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.151515Z","title":"Application of human activity/action recognition: A review,","venue":null,"work_id":"1ded02a7-cd7b-4ac5-9294-92d7dd9c1770","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.283412Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:8839eb8ad61bc0232ab8f06eb9025b2072f5b601a27f9b2a673408c3c5136efe","observation_id":"c7c678dc-bfc5-46c9-a1e2-cf44bff74945","resolution":{"observed_at":"2026-08-06T22:47:35.156090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.136615Z","title":"A survey on vision-based human action recognition,","venue":null,"work_id":"463f4234-9a49-42b9-819f-29e9de6f3dce","year":2010},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.288538Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:40fa5091a0d65201e9684b650da0042abc1da44742add909269683a9a7fa0599","observation_id":"4feace59-7424-43a4-bb02-7e2abd8f8d0e","resolution":{"observed_at":"2026-08-06T22:47:35.141108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.121285Z","title":"Review of dynamic gesture recognition,","venue":null,"work_id":"6ecf7d71-a80b-466c-915e-fe2d74617cda","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.293463Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:9b280291d8048c506108cc2811be0ba164fcdcba5e01f98b7d71ef6db6b0b35a","observation_id":"71a1ccaa-aa8b-40e4-9077-2e0f03d0d14d","resolution":{"observed_at":"2026-08-06T22:47:35.125979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.106199Z","title":"Recent advances of monocular 2D and 3D human pose estimation: A deep learning perspective,","venue":null,"work_id":"c31d7c5f-a793-46d6-9ae7-2a17e7652587","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.298490Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f2ffb4ee847504c5de9e557820dad053fc59282e9dcae1d470364626ac11f01e","observation_id":"f3b2c91b-4fb0-423e-a6c2-25af3919e41f","resolution":{"observed_at":"2026-08-06T22:47:35.111329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11631","last_updated":"2025-09-12T03:36:02Z","snapshot_observed_at":"2026-08-06T09:11:28.073489Z","submitted_at":"2023-04-23T12:10:36Z","title":"TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential","version":2},"cited_work":{"arxiv_id":"2304.11631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11631","snapshot_observed_at":"2026-08-06T22:47:34.567357Z","title":"TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential","venue":"cs.CV","work_id":"223b4dab-2303-4c88-acc3-7320b1bf5299","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.303574Z"},"links":{"cited_paper":"/paper/2304.11631","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a7bded255cc854087784462656a992362191aac3526e3b357704272698abf889","observation_id":"e9b2ca8b-8173-4f79-862c-afa716837c95","resolution":{"observed_at":"2026-08-06T22:47:34.575065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.090818Z","title":"Language knowledge-assisted in topology construction for skeleton-based action recognition,","venue":null,"work_id":"c962a6b0-a8b6-454d-b964-45c78c935eaf","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.309673Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a3bfd37e3fa2530b238fa96779b8342c85bc4bdaeab233b301257090470426cd","observation_id":"b637ffe5-3968-4e69-8420-96a331fe8d65","resolution":{"observed_at":"2026-08-06T22:47:35.095267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.074331Z","title":"ViPLO: Vision transformer based pose-conditioned self-loop graph for human-object interaction detection,","venue":null,"work_id":"e03d64ee-9951-4dfd-91dd-f8108c1feacc","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.314531Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:4f99476d84b000ca6df706d7a45c23fe7365f407133949ad3dcaac778a0d356f","observation_id":"10a3a20a-ab40-4ec4-bf79-2471350287f9","resolution":{"observed_at":"2026-08-06T22:47:35.079588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.059415Z","title":"SkeleTR: Towards skeleton-based action recogni- tion in the wild,","venue":null,"work_id":"a4d1e6d7-9db3-419d-a69c-feafbb0ea012","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.319102Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:22f336e757e5b1bc1106efc373166cd8617c51643e64e1c9148f37b8e3fc69eb","observation_id":"5c16073d-a9ea-433a-8d72-901bef64f425","resolution":{"observed_at":"2026-08-06T22:47:35.064019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.044522Z","title":"SkeletonMAE: Graph-based masked autoencoder for skeleton sequence pre-training,","venue":null,"work_id":"9d443ec9-80cf-45de-bece-8758d5427df5","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.323421Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:de640d408746419ace67a6d040518f40392add04da8853e649ed6d6f56b1a40a","observation_id":"a8b748bc-5640-400e-887f-596d71a1d7ac","resolution":{"observed_at":"2026-08-06T22:47:35.049206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.026275Z","title":"MotionGPT: Human motion as a foreign language,","venue":null,"work_id":"cf5a45d9-fd37-4be3-8888-1be5f35e5b3f","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.328303Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:69f62648b079d652dc4d022601bdb2c9e69bd1826e22281a88bfccb79ff0b4d2","observation_id":"fbc2e1a0-8d1f-4add-bac4-23d464de3bf6","resolution":{"observed_at":"2026-08-06T22:47:35.032955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-07-06T19:41:19.700669Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-06T22:47:34.333588Z","title":"MotionGPT-2: A general-purpose motion-language model for motion generation and understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.333588Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:bc288c6e047d3f43ca992148f9dcc0c3434b320b15129e13cbe3e366137093a4","observation_id":"7642b5bc-145e-42e0-868b-d97f136f5bf3","resolution":{"observed_at":"2026-08-06T22:47:34.333588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.010158Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":"131aad09-059a-4bc3-9c25-4ba4a4259e4f","year":2018},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.338903Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:df0223d59779ef8a8df734b5fde0188d6918eeabb4676d6bb83ab45f300f25d5","observation_id":"069cdd13-5cd2-4aff-9f27-abe37f255a06","resolution":{"observed_at":"2026-08-06T22:47:35.014932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.993544Z","title":"Learning 3D human pose estimation from dozens of datasets using a geometry-aware autoencoder to bridge between skeleton formats,","venue":null,"work_id":"a49ab37a-8e9b-4c1f-bd8e-5a4c79ff4224","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.343794Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:868a04406dc6d971b949f16768d9a678b6b6c888dffb53b328d2246480192cb0","observation_id":"e6b5e9e6-cf07-4ddc-88f8-f92648392fe6","resolution":{"observed_at":"2026-08-06T22:47:34.998701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.977486Z","title":"Systematic comparison of projection methods for monocular 3D human pose estimation on fisheye images,","venue":null,"work_id":"5bbd4bd5-34b0-4552-bc7a-15c7ffbf67a9","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.348854Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:6e10edd5f810545aa9e9f28de70064d5034971c09df620d7a34b3490791e96eb","observation_id":"b8e11ffb-4353-423b-af67-833eb7cbf646","resolution":{"observed_at":"2026-08-06T22:47:34.982177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.962870Z","title":"A proposed set of communicative gestures for human robot interaction and an RGB image-based gesture recognizer implemented in ROS,","venue":null,"work_id":"6ade3720-8cbc-4ca3-aae6-12b52750a4a0","year":2022},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.354122Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:d82dba16e374dd1c251c01495249d55816d0e971fb819ceb9afbfc16dbe0a8c4","observation_id":"ac32afb2-59f7-47b2-afb8-4e4c2b41ef03","resolution":{"observed_at":"2026-08-06T22:47:34.967616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.947408Z","title":"Skeleton-based action and gesture recognition for human-robot collaboration,","venue":null,"work_id":"a2d67919-d8a8-43e7-863e-775c10d15a78","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.359113Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:624ca608230fe1370ff5a730e58f8028b82a2266183b69ee78068e9d7f308700","observation_id":"3abb77d3-388f-4912-9009-bd78ffebcb8d","resolution":{"observed_at":"2026-08-06T22:47:34.952193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.932890Z","title":"Recognizing actions by shape- motion prototype trees,","venue":null,"work_id":"cb9faea7-e5dd-4972-ba63-e3fa6d2e4856","year":2009},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.364376Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:0403cdc19120fa69c4ca11ccceff383d10a4a8627e0ec683347d6c613eb80190","observation_id":"8e122873-a551-476d-b58c-ecc45ff5b8e2","resolution":{"observed_at":"2026-08-06T22:47:34.937353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.916535Z","title":"Fast gesture recognition with multiple stream discrete HMMs on 3D skeletons,","venue":null,"work_id":"ceef1b74-ac28-43cd-b919-4c91a65b06bd","year":2016},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.369733Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:6dc41f68827d23502b61226cf0cc983e91f49fc17c29e639501964018935afb8","observation_id":"a8975777-5710-4c32-ae6e-6383083a1213","resolution":{"observed_at":"2026-08-06T22:47:34.922092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.900136Z","title":"A full-body gesture database for automatic gesture recognition,","venue":null,"work_id":"a667c292-dba1-4d0e-891f-34c6fe4b1158","year":2006},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.375542Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:eb64c45876dbd32d7afb41b718f3f4b8d3225ee629292008cb661633fa410ce2","observation_id":"cb828371-08cd-4aad-a15e-7e3b16941824","resolution":{"observed_at":"2026-08-06T22:47:34.904945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.884087Z","title":"Towards controlling mobile robot using upper human body gesture based on convolutional neural network,","venue":null,"work_id":"a306aeee-9ae1-4b39-b3e3-7f398d195503","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.380576Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:18b5cf426e824a2c6ed29fd4f70acad1f306d5f16ac454a3072a3e712f8b377a","observation_id":"c42f95e3-2662-418e-8acf-6a2368d1c3ee","resolution":{"observed_at":"2026-08-06T22:47:34.888881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.867900Z","title":"Self-feedback DETR for temporal action detection,","venue":null,"work_id":"e9fc7fd7-82e6-41e1-9f9a-6eca40c88519","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.385734Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:359eced29b3bf8e158eab534ea3bc19670ce71f21995ef97c4cb369b33b284df","observation_id":"4bac6635-313a-420c-b474-1e9a1dc1d760","resolution":{"observed_at":"2026-08-06T22:47:34.873280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.851350Z","title":"Cross-modal learning with 3D deformable attention for action recognition,","venue":null,"work_id":"71786201-b0ea-4b2f-af13-3cf45c228cd9","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.391589Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:da2c95e2f1d56fac8229e3c36d2d94019502a297fa1ea4293c82ebdd44a0bc2f","observation_id":"4c2051cb-67cb-49cb-9391-fa93773ad4e2","resolution":{"observed_at":"2026-08-06T22:47:34.856474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.835050Z","title":"Zero-shot action recogni- tion in videos: A survey,","venue":null,"work_id":"b0ffd0d9-e6cd-41dd-8992-677c033cf7c7","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.396256Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:6f152b279167f24ce3d810538b5bd539bbe79a6029fed7112ac0fd2053c51596","observation_id":"87a6f8ba-3dc3-46bf-b81c-96e4308f2a61","resolution":{"observed_at":"2026-08-06T22:47:34.839879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.817193Z","title":"Foundation model and temporal priors-guided trans- ductive few-shot action recognition,","venue":null,"work_id":"aedbb7a9-c370-45c3-9518-c9afabbef214","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.400974Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:fe5e3f18b705da1df3701e4989e896a6879429c7c1e1e8c501f2e6ef75c36e18","observation_id":"ea6f2901-632f-430f-8abf-77ddc6242010","resolution":{"observed_at":"2026-08-06T22:47:34.822677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10125","last_updated":"2023-10-16T07:08:39Z","snapshot_observed_at":"2026-07-06T16:33:34.184498Z","submitted_at":"2023-10-16T07:08:39Z","title":"Few-shot Action Recognition with Captioning Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10125","snapshot_observed_at":"2026-08-06T22:47:34.406553Z","title":"Few-shot action recognition with captioning foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.406553Z"},"links":{"cited_paper":"/paper/2310.10125","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:e3111dad0ef851165028de966b9c08a5e08fa8976d70d85ca73a44a39dbfeb4a","observation_id":"979f49a6-982a-44ab-87c1-065bde4323a8","resolution":{"observed_at":"2026-08-06T22:47:34.406553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.799759Z","title":"An evaluation of large pre-trained models for gesture recognition using synthetic videos,","venue":null,"work_id":"d9875588-edba-4886-af7a-4f68841b7390","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.412765Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:8185db1193acb4687563427cf2cc632bcedff495767fcb0d2a0c9b31b879f36d","observation_id":"0ebb0d85-1253-4463-b274-983251aadb4f","resolution":{"observed_at":"2026-08-06T22:47:34.804575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.783080Z","title":"motpy – simple multi object tracking library,","venue":null,"work_id":"03870b05-1991-470e-81b6-609bf7adb915","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.418521Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:011e699dbfe76b9d7df1f8b5e22576d32215459dd465d2be7bb8c3a50b460c1a","observation_id":"2fd1c87e-3555-49bb-9d1f-95391ffaca98","resolution":{"observed_at":"2026-08-06T22:47:34.788556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.766985Z","title":"NTU RGB+D 120: A large-scale benchmark for 3D human activity understanding,","venue":null,"work_id":"09461a22-f8af-40af-95ed-f8a1f1b12be9","year":2020},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.425194Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:c324ad830fd92727f4c28fe0c9f8c6420d868cbf98bc1ed8cb46499668e7e9d1","observation_id":"a3403f9f-f524-4b28-94de-1591048e5b99","resolution":{"observed_at":"2026-08-06T22:47:34.771845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.749788Z","title":"DeGCN: Deformable graph convolutional net- works for skeleton-based action recognition,","venue":null,"work_id":"67e8464f-96fa-4749-a0d6-4335ed41465d","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.430999Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:71023e86992f0f9b1e20271b45108f4351e9c0fada66d78ab0cf6f5be124fd40","observation_id":"b673f224-615e-4016-9b0a-825f683ac416","resolution":{"observed_at":"2026-08-06T22:47:34.755000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.726242Z","title":"An image is worth 16x16 words: Transform- ers for image recognition at scale,","venue":null,"work_id":"7be03d24-ad11-44e2-8c90-195ba3012c36","year":2021},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.436642Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:f55a5dfe4ffdbc1dd22c5fc50977567a1f3d35b91071fe2853deed0a9fc4cf69","observation_id":"95486799-7c33-4432-8444-9ef4b158f1a7","resolution":{"observed_at":"2026-08-06T22:47:34.732595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.706532Z","title":"A comprehensive review of YOLO architectures in computer vision: From YOLOv1 to YOLOv8 and YOLO-NAS,","venue":null,"work_id":"8c00a478-76a5-478b-ab64-a33a7159a0d1","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.443251Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:d0a5743bae1c4f4dc3c5f38ea3cca450fb1c4153b00018bb4cfa3bdb879105a3","observation_id":"ce3c6c03-a770-4e3b-8098-eeece54c8379","resolution":{"observed_at":"2026-08-06T22:47:34.712481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.689616Z","title":"Mask R-CNN,","venue":null,"work_id":"319ba2d8-66a4-4c4c-874f-b31055c39779","year":2017},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.449123Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:fcbcaec3902694b2905de285f59be5c5bf99e6966a60f7cac82cba5f01b8fc81","observation_id":"41549042-a334-4da0-a101-2209ee975848","resolution":{"observed_at":"2026-08-06T22:47:34.694767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:35.447682Z","title":"Revisiting feature prediction for learning visual representations from video,","venue":null,"work_id":"21e036c2-d163-40b8-ada3-cf2737cd85d2","year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.455154Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:a4a3f7f9f58b1a0f4bfa8edc4316bcbf59f9b529cec385b9e2bdf73db8209abf","observation_id":"4130f14f-5326-4a80-9fb3-3acf11f9cfa1","resolution":{"observed_at":"2026-08-06T22:47:35.452383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.670057Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis,","venue":null,"work_id":"3678a20b-a05c-4c70-88da-5596e5b69d69","year":2025},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.464140Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:2a3024bff6ab66b5d1da75a657832b33b2c04972fe9d84c451954afaee9f4cad","observation_id":"56cbf492-f6af-4605-940f-70fb17cc15d1","resolution":{"observed_at":"2026-08-06T22:47:34.676310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.649422Z","title":"Mistral 7B,","venue":null,"work_id":"58fc656f-1376-4fb6-a1df-01231db6c612","year":2023},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.470001Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:bd53a5c50d16a89065553d97cdf499041e915bfe82494586e5f70114f28a67b7","observation_id":"7a37d2ec-08ec-4894-8c94-9cd885153725","resolution":{"observed_at":"2026-08-06T22:47:34.654857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:47:34.631500Z","title":"3D human pose estimation in video with temporal convolutions and semi-supervised training,","venue":null,"work_id":"2a37a611-9ce6-4d28-9875-4b4bc6bd59e3","year":2019},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.476382Z"},"links":{"citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:13580e67e73810ab3409f505174f1ce7d90bc8eb11776276bb273f367124b10f","observation_id":"c56fc7a1-a5e0-41ba-ab39-f401ab6dd02e","resolution":{"observed_at":"2026-08-06T22:47:34.636984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":62},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.20795."}