{"as_of":"2026-08-08T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dac601fdddc4c78c1f0d235163631efbb8f4dfecff263b0919af5eea9ae060c","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:21:15.822933Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17342/citation-record","integrity":"/paper/2607.17342/integrity","json":"/paper/2607.17342/citation-record.json","paper":"/paper/2607.17342"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:05.870239Z","title":"Hierarchical aggregated graph neu- ral network for skeleton-based action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:05.870239Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:7ac40f11b2143f61ed3be51707b365ecc34d648b9790e00da83bf5246cd75680","observation_id":"ca4c888a-b52c-4874-8303-70944e1ac3c1","resolution":{"observed_at":"2026-08-01T18:21:05.870239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.025703Z","title":"Joints-centered spatial-temporal features fused skeleton convolution network for action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.025703Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:7398e3d012774fe22dd9806214fb0e1ecb7b0f9a1688c523989a2750fbfe12b4","observation_id":"9b765c17-f9c2-493d-8469-32d58e4480a5","resolution":{"observed_at":"2026-08-01T18:21:06.025703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.155909Z","title":"Noise- tolerant learning for audio-visual action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.155909Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:fc0567f8941a201d8d29a8538f859a9fafdd7624f97268e65d0bdfd59d3ab0a9","observation_id":"0865a89f-2e2b-4a3f-9dee-72e9bd25e420","resolution":{"observed_at":"2026-08-01T18:21:06.155909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.254920Z","title":"Commonsense knowledge prompt- ing for few-shot action recognition in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.254920Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:09cbb49f85c0f8d4344534fd1a9941799f277ea6ed181b8f2731761a41c72881","observation_id":"88d89667-bd2d-4ad9-993d-f105e20b94a4","resolution":{"observed_at":"2026-08-01T18:21:06.254920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.385794Z","title":"Exploring rich semantics for open-set action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.385794Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:8658741218c40ad828b9c870758981999f2dc8a227fb4fdf1e3877878d2b9f94","observation_id":"9052d824-5e18-41ef-966a-0b2c76484b24","resolution":{"observed_at":"2026-08-01T18:21:06.385794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.519119Z","title":"Dear-net: Learning diver- sities for skeleton-based early action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.519119Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:096785932512ea46ac44072ad063b11e2ed7538e949c90efb1adccfb73459e3e","observation_id":"c24a9bfe-dbab-46be-ac7a-287c24662648","resolution":{"observed_at":"2026-08-01T18:21:06.519119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.678110Z","title":"Just addπ! pose induced video transformers for understanding activities of daily living,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.678110Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:fa643142f4b64f2253997a0eda37ef0cb41da844f0870d16166d12ce80a80211","observation_id":"19891e92-ff07-43d1-87e4-308afd80b234","resolution":{"observed_at":"2026-08-01T18:21:06.678110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.842033Z","title":"Mmnet: A model-based multimodal network for human action recognition in rgb-d videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.842033Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:00f79af01305dd761f2db3c53e646366a13708cd7307bb3cc3d4bea02d4a04ef","observation_id":"a3ecaa31-05e0-476a-86c3-61a9acbf768a","resolution":{"observed_at":"2026-08-01T18:21:06.842033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:06.979863Z","title":"A unified multi- modal de- and re-coupling framework for rgb-d motion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:06.979863Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3e57293e73e218006bbe110406e431d5fe403526ae19d02a5f9f12a47e11c824","observation_id":"138c428b-cac7-4e11-a19b-13e87f00e704","resolution":{"observed_at":"2026-08-01T18:21:06.979863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.154747Z","title":"Selective, interpretable and motion consistent privacy attribute obfuscation for action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.154747Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:c6ddb8e058c32ef14edc9a3fd88f910dc9b03dc39595d7b334897ce5728e4f46","observation_id":"8b74b0b7-f76b-4e68-a0f1-714ff93c2085","resolution":{"observed_at":"2026-08-01T18:21:07.154747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.274920Z","title":"On the benefits of 3d pose and tracking for human action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.274920Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:1e8ccf418f64e7ed0ac2f595060c88ecfa2010554574e3998c1f5d13777e4a8a","observation_id":"16f462a8-bcba-4862-8424-efb44a94c400","resolution":{"observed_at":"2026-08-01T18:21:07.274920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.407153Z","title":"Smam: Self and mutual adaptive matching for skeleton-based few-shot action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.407153Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:c9b84260d06e94c67a871c130e4e1dc09425f48128eae8ff70c692f624b37819","observation_id":"10992860-6f31-436e-a9ef-a673ea25656e","resolution":{"observed_at":"2026-08-01T18:21:07.407153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.564684Z","title":"Integrating image and textual information in human–robot interactions for children with autism spectrum disorder,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.564684Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:933b056297747ce6af94d3a9cf3f3128f049d49fbae4884eca9dd08d61d643af","observation_id":"7bd2c819-c5ab-40b3-8b18-12962e440a26","resolution":{"observed_at":"2026-08-01T18:21:07.564684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.647090Z","title":"Jrdb-social: A multifaceted robotic dataset for understanding of context and dynamics of human interactions within social groups,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.647090Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:1270337231fd1abfe1b0797aceb6723b5668143e6a8f899eae0a55561d1affd3","observation_id":"dd9a4851-46fb-4f66-b79e-a3f253f2e8e4","resolution":{"observed_at":"2026-08-01T18:21:07.647090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.805971Z","title":"Interactive spatiotem- poral token attention network for skeleton-based general interactive ac- tion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.805971Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:43c747a7e7de4ae6a1dd5ac5717e49ce26bab3062ab5ff321a1e13d68b57d919","observation_id":"006184e0-4dc3-4899-acdb-9155ed156245","resolution":{"observed_at":"2026-08-01T18:21:07.805971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:07.957296Z","title":"Pose forecasting in industrial human-robot collaboration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:07.957296Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:428e73132627ef538032e34346ac827b607c3d7d8c58556f4b379885bc09fd94","observation_id":"62c8a668-c129-4e0c-bd01-bc89b3288ff7","resolution":{"observed_at":"2026-08-01T18:21:07.957296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.080287Z","title":"Exploring 3d human pose estimation and forecasting from the robot’s perspective: The harper dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.080287Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:4a7f7aa2d73d541cbf6ef85fc15a9852a092a1c42f62d568122b00907a11b6a9","observation_id":"6b5d5d2e-8a72-40d9-a186-540bdfdfd6ec","resolution":{"observed_at":"2026-08-01T18:21:08.080287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.198270Z","title":"Pedestrian trajectory prediction based on social interactions learning with random weights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.198270Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:70a9d98e3c81acd8f0142c2e123756cc49ed9e1038b29e09c5a6205b9a18a816","observation_id":"3a702bf3-228f-4017-bfa5-50a611012473","resolution":{"observed_at":"2026-08-01T18:21:08.198270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.347674Z","title":"Inter- action transformer for human reaction generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.347674Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:a2453c7e8f4853fd770f17e284a4fa896c2924b65343c661a8084e6c32e22911","observation_id":"fc03cde0-7245-41b7-901e-78032a0e6808","resolution":{"observed_at":"2026-08-01T18:21:08.347674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.507578Z","title":"Spikepoint: An efficient point-based spiking neural network for event cameras action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.507578Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:73bb5e22b7570ec90cba3dd3b4ddde0af775fbbfe7aa5637fc5603f18f289832","observation_id":"e9d4493e-8bbc-4e18-b956-7c56b63d16cc","resolution":{"observed_at":"2026-08-01T18:21:08.507578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.628639Z","title":"Scaling up dynamic human-scene interaction modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.628639Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:f6743267fd8f917adb96bb708b5137cb7f271dfac683c4848e7f80d38ab6d348","observation_id":"715e2d7b-ce51-49ec-936b-bc1098b61f4a","resolution":{"observed_at":"2026-08-01T18:21:08.628639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.744687Z","title":"An outlook into the future of egocentric vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.744687Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:ac6c22a4ef5b1b4139edd09d3cc87b7623867ac4cef69e27d6a0abc4f916d2f6","observation_id":"16147045-7862-42f4-84dd-9cd21211dbff","resolution":{"observed_at":"2026-08-01T18:21:08.744687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:08.939805Z","title":"Locllm: Exploiting generalizable human keypoint localization via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:08.939805Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:1eea07398121f4bad0748637c0fa96570f5936ee16efc4af87c6fab7e9c68aa6","observation_id":"4e70bb91-850b-4b06-ac1c-5b5ef2bd1371","resolution":{"observed_at":"2026-08-01T18:21:08.939805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.071792Z","title":"Intergen: Diffusion- based multi-human motion generation under complex interactions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.071792Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:50aebe91deffc62936f3e2d47f71a5f89de518124b4338b2950814e6af9cce51","observation_id":"9c8e1a10-089e-49b5-8294-221884c576cb","resolution":{"observed_at":"2026-08-01T18:21:09.071792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.207086Z","title":"Multi-modal & multi-view & interactive benchmark dataset for human action recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.207086Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:e52e298518523049bd5f191bcb4d1d98d208f9ec5adf47afe92958b3506b7837","observation_id":"bb1cf15f-214f-45b3-ad92-1e5c6473488e","resolution":{"observed_at":"2026-08-01T18:21:09.207086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.333298Z","title":"Motionbert: A unified perspective on learning human motion representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.333298Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:cb54cee039635f29f0585008d173d80eb4f83ccbb8433ace1199f43700498704","observation_id":"ccdbfb8f-fd20-4f22-9ae3-457b8db54e24","resolution":{"observed_at":"2026-08-01T18:21:09.333298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.468523Z","title":"Versatile multi-modal pre-training for human-centric perception,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.468523Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:e7accd0cdbd1553b187c41cd07b0f35904d106cb2adbb147f7ab725bb50c7f71","observation_id":"937a3b7b-6912-419a-b084-f35cb2d70762","resolution":{"observed_at":"2026-08-01T18:21:09.468523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.599539Z","title":"Beyond appearance: A semantic controllable self-supervised learning framework for human-centric visual tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.599539Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3db93c95a6d8606b315cf2f159f07c61d629445dacd7bfcd92125ac149ccbed2","observation_id":"3cde418e-c44e-4582-9e53-d6db309c8b39","resolution":{"observed_at":"2026-08-01T18:21:09.599539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.728196Z","title":"Humanbench: Towards general human-centric perception with projector assisted pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.728196Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:eb8a40ade5faa23d84fbf92f04dbe76331bed895feb234c62268e22cff705a0e","observation_id":"6dfbe9fd-f3e9-4e7e-a78f-089b5aa2f6cc","resolution":{"observed_at":"2026-08-01T18:21:09.728196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:09.870162Z","title":"HAP: Structure-aware masked image modeling for human- centric perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:09.870162Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:1c03e50a9f459ec9e683d72048276879da06404c282a876533d4b6e563601b6c","observation_id":"88087bd6-f4b4-4694-9dcc-ae4c80cd8c1d","resolution":{"observed_at":"2026-08-01T18:21:09.870162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.039313Z","title":"Unihcp: A unified model for human-centric JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 12 perceptions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.039313Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:577955f1d7acad7536e7c001d801dae670b5ad09ebd7e2a18b568b23d2186af7","observation_id":"53510277-eb4e-4d08-abed-cbc4265cb08f","resolution":{"observed_at":"2026-08-01T18:21:10.039313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.107867Z","title":"Hulk: A universal knowledge translator for human-centric tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.107867Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:e37a6a4104198c1e8c51f7dc7b47b24656da25f7bb5e4b088631a79565d809cb","observation_id":"68df8d62-f674-45f1-ac40-9d99621af5bf","resolution":{"observed_at":"2026-08-01T18:21:10.107867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.171164Z","title":"Sapiens: Foundation for human vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.171164Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:ee5ac690dcfbc8e553de6a781db7581ecfa1e302e1230b1a674818892b835ed6","observation_id":"a019db20-488c-4524-a5df-1465153c89de","resolution":{"observed_at":"2026-08-01T18:21:10.171164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.252072Z","title":"Learning composite latent structures for 3d human action representation and recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.252072Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:91b2f2ab4310c3270d37ff2b2576f1542f582fd0225686b72f88a5876eb1606f","observation_id":"69816185-55a7-428e-83b9-04e068e93bc6","resolution":{"observed_at":"2026-08-01T18:21:10.252072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.339072Z","title":"Navigating open set scenarios for skeleton-based action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.339072Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:f042cd2e74212eebda82060497274fac167a66d474f31df6286729c91d3078ba","observation_id":"b816ee79-436a-4aa9-a21d-154e04570a36","resolution":{"observed_at":"2026-08-01T18:21:10.339072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.423294Z","title":"One-shot action recognition via multi-scale spatial-temporal skeleton matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.423294Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:aae03dfff8d98e30f5d1e80d0fa8ee317a64968bce317d4d4e992acc5fa49a9d","observation_id":"11b9be82-a03c-4f87-9fee-b7b812393c97","resolution":{"observed_at":"2026-08-01T18:21:10.423294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.511699Z","title":"Self- supervised 3d action representation learning with skeleton cloud colorization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.511699Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:af10022296acae44b59b8693fa04df819fed994d6d32d2cfc472cb46bafd65fe","observation_id":"bba65aa2-08e9-46b3-954c-cd312822234d","resolution":{"observed_at":"2026-08-01T18:21:10.511699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.605490Z","title":"Meet jeanie: A similarity measure for 3d skeleton sequences via temporal-viewpoint alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.605490Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:1c84ed44f3d52c009df7cd0d120f6799cb0e73d1c0097a02ac445b0b9aaa19a1","observation_id":"1251f32b-c627-403b-8f4c-83fef751cf60","resolution":{"observed_at":"2026-08-01T18:21:10.605490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.669063Z","title":"Neural koopman pooling: Control- inspired temporal dynamics encoding for skeleton-based action recog- nition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.669063Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:0e4cedc10f1ff49d7bcf152d2255c6f0551aef3df2f2891bf26275dd7aaa518b","observation_id":"bf7d9ebc-9d10-4b2f-961e-77c51504ba63","resolution":{"observed_at":"2026-08-01T18:21:10.669063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.741353Z","title":"Learning discriminative representations for skeleton based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.741353Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:cb00728f4e7aebb4e583aeaed29f9adbba3e1bdc6295304f71531f0a19771c87","observation_id":"9add6cab-d677-4f7b-8cdc-73838cce3cf6","resolution":{"observed_at":"2026-08-01T18:21:10.741353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.835258Z","title":"You2me: Inferring body pose in egocentric video via first and second person interactions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.835258Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:58fbcdf8966b1d451b0ec03d26c471d0b6f5e286fc7fbedb9efd1d64ad241bbb","observation_id":"fb41a10e-cd69-4121-a943-9d045e0eb36b","resolution":{"observed_at":"2026-08-01T18:21:10.835258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.894319Z","title":"Skeleton- based online action prediction using scale selection network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.894319Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:cc9a33a8db77589532f8fda615de1859a712ee74267ab3c06ad3da3938731cc8","observation_id":"1ea350e8-234b-43f5-aa0d-547848b09103","resolution":{"observed_at":"2026-08-01T18:21:10.894319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:10.977644Z","title":"Interaction relational network for mutual action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:10.977644Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:8d94417ccba19fae6377376dc79fd9a2784a38051f20a0c50446eeb51db1affd","observation_id":"46cec846-8352-4d20-afa6-5e576f201d7c","resolution":{"observed_at":"2026-08-01T18:21:10.977644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.041954Z","title":"Igformer: Interaction graph transformer for skeleton-based human interaction recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.041954Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:c96449478b742a4e240cb10fae56f26d1c8f89d8677f2d86a8175bdd6fdfe686","observation_id":"ef4c0f2a-53d8-4ed3-958b-9af1f6d19571","resolution":{"observed_at":"2026-08-01T18:21:11.041954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.120093Z","title":"Graph diffusion convolutional network for skeleton based semantic recognition of two- person actions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.120093Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:22741c5ea392e6e2c5fa928e47f1ed5c5dde83ee62a4615aca85a6d3c38487d6","observation_id":"81826e0b-8289-4224-aa87-e7c3ea67a03c","resolution":{"observed_at":"2026-08-01T18:21:11.120093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.209558Z","title":"Learning mutual exci- tation for hand-to-hand and human-to-human interaction recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.209558Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3ced19aec4eeee4aa82c95bb4c28b616dee10d4afc6f0d968d72e134ea390229","observation_id":"4253bbd4-1e64-47ae-8269-db485fbb7a32","resolution":{"observed_at":"2026-08-01T18:21:11.209558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.277404Z","title":"Multi-modal enhancement transformer network for skeleton-based human interaction recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.277404Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:161be0c4c862053dbb43af07c607ab9043003cde3fc33a212dfa8d19911599c9","observation_id":"921396eb-720f-4aee-89a6-a686cb3253e4","resolution":{"observed_at":"2026-08-01T18:21:11.277404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.338171Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.338171Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:48187cb935c41eabc857358c45330b8bfc85d13012fff74c52431bb0177014b9","observation_id":"a677233b-c529-48f4-9ad5-69ff26764177","resolution":{"observed_at":"2026-08-01T18:21:11.338171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.399876Z","title":"Ntu rgb+d 120: A large-scale benchmark for 3d human activity understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.399876Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:b9a4ae37baf025b6b70b6485c2a185435820bf490bcb9c08f04b38a05608a716","observation_id":"7026743f-479a-4ac8-a9a3-f2217492a883","resolution":{"observed_at":"2026-08-01T18:21:11.399876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.465759Z","title":"Cross-view action modeling, learning, and recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.465759Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:cb054c2be9142fffb1b265fab6c3a547c53f09c3714509bc7d77f6147bd91c43","observation_id":"a077b748-e073-4bcc-b7c7-4baac3985236","resolution":{"observed_at":"2026-08-01T18:21:11.465759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.530526Z","title":"Pku-mmd: A large scale benchmark for skeleton-based human action understanding,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.530526Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:18d6c574861eb52bfe5aea10b8c30604458548e6e481cebe25263ebcd1161310","observation_id":"954958a8-515f-42fb-a328-35f8f7ca4df5","resolution":{"observed_at":"2026-08-01T18:21:11.530526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.585362Z","title":"Toyota smarthome: Real-world activities of daily living,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.585362Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:2b993ed5ef3915fd7a0dbbbe485ee99ef17705cff717ba5b35fb2499ce5ce5c6","observation_id":"c560dc9a-680b-4689-b28e-b353030dfbab","resolution":{"observed_at":"2026-08-01T18:21:11.585362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.645610Z","title":"Assemblyhands: Towards egocentric activity understanding via 3d hand pose estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.645610Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:ba6e2aea262dbc09a441fc976ef122882c46c0095f5617acbb9c0aab50fe38cc","observation_id":"05e1bf88-6c1d-4c99-81df-c1abed806a04","resolution":{"observed_at":"2026-08-01T18:21:11.645610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.736107Z","title":"Hi4d: 4d instance segmentation of close human interaction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.736107Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:6e996c5ab3cf3b755efe08523ecc15a1b457b75f1c2f1c302c31497e83fe5c93","observation_id":"3b12d4f8-6b9f-4aa9-9ce9-c21e7a3bad7d","resolution":{"observed_at":"2026-08-01T18:21:11.736107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.841894Z","title":"Inter-x: Towards versatile human-human interaction analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.841894Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:b4f4100b57fb694bb6d59c57a134f40bea47210a9a352d9f853bd5d4ff91f0f3","observation_id":"0e3f7ffe-dcea-4678-aa2c-2130e4ae9743","resolution":{"observed_at":"2026-08-01T18:21:11.841894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:11.931996Z","title":"Intergen: Diffusion- based multi-human motion generation under complex interactions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:11.931996Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:e3fe53c8410d61b66c27110dc9406434f4322dc565ab976009e529c3611c1796","observation_id":"49a22bd0-b2ef-4209-87ea-a56b241b0ad7","resolution":{"observed_at":"2026-08-01T18:21:11.931996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.019710Z","title":"Co- occurrence feature learning for skeleton based action recognition using regularized deep lstm networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.019710Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:172d939ab1c37d4cbf35f78e0c48e5ab32a78ea522d2fb4e6c2fe34c79176329","observation_id":"1962c390-3198-440f-83f9-01174a62e532","resolution":{"observed_at":"2026-08-01T18:21:12.019710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.104857Z","title":"Spatio-temporal lstm with trust gates for 3d human action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.104857Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:eafb683fa743d6ffc17bde254cfcc069a37458b41e2d86fac08c88c918c9216e","observation_id":"7e570168-d120-421c-aef8-61588b8fb13f","resolution":{"observed_at":"2026-08-01T18:21:12.104857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.199712Z","title":"Global context- aware attention lstm networks for 3d action recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.199712Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:78abf1465648110bad1596c37a8be821f1bea39359464a5f68cb1c322b6e6146","observation_id":"58a98e70-e3bf-4fda-9255-4003d7b0539c","resolution":{"observed_at":"2026-08-01T18:21:12.199712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.270756Z","title":"View adaptive recurrent neural networks for high performance human action recognition from skeleton data,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.270756Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:034778d4d9da1e746ad908836042ec6610f7646e7f5d031a913dea80e5f019e9","observation_id":"0cf724c6-1915-476b-867d-e92c461ae28f","resolution":{"observed_at":"2026-08-01T18:21:12.270756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.337676Z","title":"Skeleton- based human action recognition with global context-aware attention lstm networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.337676Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:18e7d833e5f6de25998acb9a968970f300eea3040a0d8e7ff420aa8d371d2d19","observation_id":"5b209244-70a6-428a-8bc8-2ef5a5073cb7","resolution":{"observed_at":"2026-08-01T18:21:12.337676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.423657Z","title":"View adaptive neural networks for high performance skeleton-based human action recognition,","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.423657Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:2a8732299c191e58922205d9db30f1fdbf9d5644724cb57ec46c2edc286be1ee","observation_id":"23ced6bd-bc2d-4956-82fd-c3df7991a616","resolution":{"observed_at":"2026-08-01T18:21:12.423657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.486465Z","title":"Spatial temporal graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.486465Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:24b735f5a5350bcf00bd68a251d4dbfdb722c5c36ae30b944986e656cc1c5278","observation_id":"b4666388-3143-4b94-9549-c840d6a7a990","resolution":{"observed_at":"2026-08-01T18:21:12.486465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.569946Z","title":"Actional- structural graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.569946Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:d45d1caf1b29b5f402b3f9fb5adfd0670235d9a7501a8ed51e476a2e9fdbe185","observation_id":"c91601c3-5257-4076-964d-4089b1d86e7b","resolution":{"observed_at":"2026-08-01T18:21:12.569946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.642871Z","title":"Two-stream adaptive graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.642871Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:24e5e16cce0a594dc0305aff5be82dd859a2cbddb7647774f9fc0459ce5262cc","observation_id":"5e60b00b-d27e-4d95-8591-6115b7e229a4","resolution":{"observed_at":"2026-08-01T18:21:12.642871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.707488Z","title":"Disentangling and unifying graph convolutions for skeleton-based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.707488Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:554d1123721c3b6ae19525941124730462abba1319e316f93bf6c38c55d36787","observation_id":"7a319087-4600-419c-8a22-2fcc4f5bde15","resolution":{"observed_at":"2026-08-01T18:21:12.707488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.805008Z","title":"Channel- wise topology refinement graph convolution for skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.805008Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:a6efd8fc6fe786cbd25c127cc9c69a538d93e3f75562fb2cf01ba8b2f3ea6f77","observation_id":"abd5269c-81bc-4ad2-b8d0-f57c64d059e3","resolution":{"observed_at":"2026-08-01T18:21:12.805008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.847241Z","title":"Infogcn: Representation learning for human skeleton-based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.847241Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:8dd3b074ba46d4534732251e799cde332a40c57938c85a2b19c3dfaa2e40d7b6","observation_id":"239522a0-ef9a-4753-9819-2ccd8df1ed31","resolution":{"observed_at":"2026-08-01T18:21:12.847241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:12.933769Z","title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:12.933769Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:0f4e1a83034f82848cc98b8bc52e27f61b0a6b8752f025183293f59890409fb8","observation_id":"18d3ee4d-9f2d-483b-8ee3-58ffde788df7","resolution":{"observed_at":"2026-08-01T18:21:12.933769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.020006Z","title":"Hypergraph neural network for skeleton-based action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.020006Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:4a156c1e73ff03d25e19d0d172597b3c90ff41023427480ea1f6285eba187bc5","observation_id":"6fe8c15d-4a3f-4d8c-aa53-dae0e6da72c7","resolution":{"observed_at":"2026-08-01T18:21:13.020006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.120271Z","title":"Pyskl: Towards good practices for skeleton action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.120271Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:8135f698ba62c05a45722c63b1cc77dd9b4f09f2ee9537c32c5b721029696010","observation_id":"b284625b-d0c0-488d-8f5b-56bf8af7e2bf","resolution":{"observed_at":"2026-08-01T18:21:13.120271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.175203Z","title":"Tsgcnext: Dynamic-static multi- graph convolution for efficient skeleton-based action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.175203Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:726b2ef967724cc57ff2ac63f4fad6e9e7d4645d5ed7a43cd13cf13d38148061","observation_id":"bce7de06-1296-49ab-b837-5d4959723de2","resolution":{"observed_at":"2026-08-01T18:21:13.175203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.258049Z","title":"Degcn: Deformable graph convolutional networks for skeleton-based action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.258049Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:9dbd2dc5057c9a5dddc03ec540129454b6a108c10eaeb82a55163427d63ad275","observation_id":"89205f9b-a9e2-4a26-9050-75cef5936e05","resolution":{"observed_at":"2026-08-01T18:21:13.258049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.325175Z","title":"Blockgcn: Redefine topology awareness for skeleton-based action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.325175Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3246b6db97b1c7e21c6ac39ecf5c8feaa3302a8f6a181157be898e913a514799","observation_id":"4a259862-c210-488a-8454-4309140538e4","resolution":{"observed_at":"2026-08-01T18:21:13.325175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.376027Z","title":"Decoupled spatial-temporal attention network for skeleton-based action-gesture recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.376027Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:dd9004c98589d4594442233a8e58907b5e1baba9a7644735aac4f60ab248a438","observation_id":"61941a91-3db5-47bc-994a-509ae710b6f9","resolution":{"observed_at":"2026-08-01T18:21:13.376027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.491933Z","title":"Spatio-temporal segments attention for skeleton-based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.491933Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:ec832e8fb780d94a44e50b835a0120e3918a74dace1b831e91507ff2610cd687","observation_id":"7d908153-5491-4679-b4f7-8f9596087bc0","resolution":{"observed_at":"2026-08-01T18:21:13.491933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09590","last_updated":"2023-03-21T17:34:34Z","snapshot_observed_at":"2026-07-06T14:19:51.472138Z","submitted_at":"2022-11-17T15:36:48Z","title":"Hypergraph Transformer for Skeleton-based Action Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09590","snapshot_observed_at":"2026-08-01T18:21:13.534206Z","title":"Hypergraph transformer for skeleton-based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.534206Z"},"links":{"cited_paper":"/paper/2211.09590","citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:42c3ec3bd1fd6f51355f3237c5ef4c85bc9581c1e2bdc4c4e79ac8991aee4a68","observation_id":"c8cb5b93-cec8-4851-9b02-89d7bb7ea793","resolution":{"observed_at":"2026-08-01T18:21:13.534206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.618486Z","title":"A cuboid cnn model with an attention mechanism for skeleton-based action recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.618486Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:7a80aafbdefa60b8d2dfb806c8bf96a7f50b5747cfe798cdb28544baa1f4a2ed","observation_id":"d8713d02-dd39-4870-8939-421bf891220c","resolution":{"observed_at":"2026-08-01T18:21:13.618486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03288","last_updated":"2023-12-06T04:36:58Z","snapshot_observed_at":"2026-07-06T16:57:34.388852Z","submitted_at":"2023-12-06T04:36:58Z","title":"STEP CATFormer: Spatial-Temporal Effective Body-Part Cross Attention Transformer for Skeleton-based Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03288","snapshot_observed_at":"2026-08-01T18:21:13.704217Z","title":"Step catformer: Spatial-temporal effective body- part cross attention transformer for skeleton-based action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.704217Z"},"links":{"cited_paper":"/paper/2312.03288","citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3be4945da42f8a113c1bfba73b55b03c95af785186288918db9cb1506cc56809","observation_id":"0efc7719-e3d1-4a25-b2bd-211f961d4aeb","resolution":{"observed_at":"2026-08-01T18:21:13.704217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.759196Z","title":"Masked motion predictors are strong 3d action representation learners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.759196Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:764e622fe5869c4e532d61d2e5846ad487027b36cacc896cd47d836310e3375a","observation_id":"73ab89bc-4da1-4997-b6ee-5945e1e346ca","resolution":{"observed_at":"2026-08-01T18:21:13.759196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.817039Z","title":"Psumnet: Unified modality part streams are all you need for efficient pose-based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.817039Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:7583c2f0f3ad4b79673a4c5f8de25c0a1e211506605b7d993349b2c0a54f3f54","observation_id":"d56557d4-e197-4be0-94f2-d429fbbb86be","resolution":{"observed_at":"2026-08-01T18:21:13.817039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.886737Z","title":"Skateformer: Skeletal-temporal transformer for human action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.886737Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:0c9c4c6d093c0e86322045ff70baff486400c5446330c4d954157c81b39c768a","observation_id":"323c8ea3-cfab-45f6-a88e-afe45d40ba91","resolution":{"observed_at":"2026-08-01T18:21:13.886737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:13.971238Z","title":"Multiview skeletal interaction recognition using active joint interaction graph,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:13.971238Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:f8eede321ea322aaceafdd24436a2f1b959fa82b361d7915e370cfb346d56bc3","observation_id":"5781b28b-6313-470d-aea4-7b76d77abe6c","resolution":{"observed_at":"2026-08-01T18:21:13.971238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.058803Z","title":"Interactive body part contrast mining for human interaction recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.058803Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:09506818dd1bdfc3a96559c8b9dafc02a2b1dc37ee479e568128b215b827fad6","observation_id":"c52fd08a-b417-4ad8-8832-5f88a5d5a37d","resolution":{"observed_at":"2026-08-01T18:21:14.058803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.118038Z","title":"Chase: Learning convex hull adaptive shift for skeleton-based multi-entity action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.118038Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:eb54aa31d13e3a8bcbc2052a15ac75e86687976fd12a83dc07d750d5937959f1","observation_id":"0147526d-3360-4cbf-ac5d-85bbc6a14995","resolution":{"observed_at":"2026-08-01T18:21:14.118038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.191847Z","title":"Skeletr: Towards skeleton-based action recognition in the wild,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.191847Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:5c59064cdee2234a2611ac4ada56229e784ce0ef43676eb87e279d21ce167302","observation_id":"7a01ce0f-e7af-486b-8472-7d9420d7cb2e","resolution":{"observed_at":"2026-08-01T18:21:14.191847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.274373Z","title":"Assembly101: A large-scale multi-view video dataset for understanding procedural activities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.274373Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:29db17365b616cba45c9fc4501a5e440d385718c3368d1f219a5c1dd9afb4566","observation_id":"5c995f58-9dbb-4e94-92e8-66d54f4ffd67","resolution":{"observed_at":"2026-08-01T18:21:14.274373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.422750Z","title":"Hi- erarchical temporal transformer for 3d hand pose estimation and action recognition from egocentric rgb videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.422750Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:b2113241cef7e6e475798a00b660fc41efb9c626034b817304ef582d68fcaeda","observation_id":"7b59badd-1d3a-4721-b2eb-14eb596613f8","resolution":{"observed_at":"2026-08-01T18:21:14.422750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.565208Z","title":"H2o: Two hands manipulating objects for first person interaction recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.565208Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:a490506357a91f24deef63af74b405eb6f00be5ce633ca997e7980232263d31c","observation_id":"a04c70f9-a7e4-42c4-a759-53eb3bd9df1c","resolution":{"observed_at":"2026-08-01T18:21:14.565208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.688115Z","title":"H+o: Unified egocentric recog- nition of 3d hand-object poses and interactions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.688115Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:2750f7bfd346eb7d3d2ba4ae941f21407d3463f6c8063990cffc54bf855969a5","observation_id":"2590d7a6-6a85-4adc-9297-e88e1634a877","resolution":{"observed_at":"2026-08-01T18:21:14.688115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.828571Z","title":"On the utility of 3d hand poses for action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.828571Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:4052633534023b62ecfd675e4320d7747ccb22c8ef4af2d0d36845706c50287f","observation_id":"5131161e-cf06-4d02-9a33-c8b979b06b45","resolution":{"observed_at":"2026-08-01T18:21:14.828571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:14.937220Z","title":"Transformer-based unified recognition of two hands manipulating objects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:14.937220Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:e5f3eed6c35abffe63ab5dae87eee909e056a4b8da95e689c3b74ec940fd01a6","observation_id":"1abba3cd-dbdf-40d7-8b16-b23f397b5d68","resolution":{"observed_at":"2026-08-01T18:21:14.937220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.108508Z","title":"In my perspective, in my hands: Accurate egocentric 2d hand pose and action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.108508Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:6c9d070b99b604c4f6720c5945431129b8c0995dbd5b1c9782f47b8b197583c7","observation_id":"0f3ff4e7-6f20-469b-bb96-23fe62c1c32b","resolution":{"observed_at":"2026-08-01T18:21:15.108508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.240265Z","title":"B2c-afm: Bi-directional co-temporal and cross-spatial attention fusion model for human action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.240265Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:14fd02b6a2a0de50ef61318e388e7aa8e08d0349073737005f28df90a06e6cc9","observation_id":"6581e412-6bde-41ae-a9fc-7c08277d89ca","resolution":{"observed_at":"2026-08-01T18:21:15.240265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.379747Z","title":"Cross-modal learning with 3d deformable attention for action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.379747Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:6a7a9d55f7412936d9e439f678a33955520fa5c534cda2cd287eac866ab2b884","observation_id":"bc771137-6408-4c40-aa4e-ad3147f2a8be","resolution":{"observed_at":"2026-08-01T18:21:15.379747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.498039Z","title":"Vpn++: Rethinking video- pose embeddings for understanding activities of daily living,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.498039Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:3661e7dee9997fd212e6ca0f58b766a899292507cd4b513d5c2b0209ecaee7bc","observation_id":"4732a5a2-9a9e-4c5f-afe1-d95811ae4a02","resolution":{"observed_at":"2026-08-01T18:21:15.498039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.613900Z","title":"Revisiting skeleton- based action recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.613900Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:6dc33627d76e83e6c8aab2664e53ca305228a438a8a96fc533dd805d802b59c9","observation_id":"73258562-4bc5-4e67-931d-b6c457569a18","resolution":{"observed_at":"2026-08-01T18:21:15.613900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.671833Z","title":"Star-transformer: A spatio- temporal cross attention transformer for human action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.671833Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:cd82e4e52e48c80c1cd71c01da9f919a936fec11ae49bb055c9d742954a9fa7e","observation_id":"5c8db89e-55d3-4d30-9ee5-b57cfcfa881f","resolution":{"observed_at":"2026-08-01T18:21:15.671833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.722978Z","title":"Multi- view action recognition using contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.722978Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:53cfd6471efca299b7470a7d3dd0246506f3dd33f85e0ea82b109e67d1a1af2e","observation_id":"7d649ab9-b2bb-4990-9b89-4ca4899181ad","resolution":{"observed_at":"2026-08-01T18:21:15.722978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:21:15.822933Z","title":"Explore human parsing modality for action recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-01T18:21:15.822933Z"},"links":{"citing_paper":"/paper/2607.17342"},"observation_digest":"sha256:80e94820fbd5b9f1ac13f6957e2befad7a476bcc4e6d427e74c45f28d19bdf20","observation_id":"c5e4f397-0ee3-436c-b779-728d798c8cb7","resolution":{"observed_at":"2026-08-01T18:21:15.822933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17342","last_updated":"2026-07-19T17:05:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T18:21:01.645784Z","submitted_at":"2026-07-19T17:05:46Z","title":"STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 0 inbound Pith citation observations for arXiv:2607.17342."}