{"as_of":"2026-08-08T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:094a8cda9ab988966bb1a6fe29a10de0148fcf6867ed6420bf42d4bd09457756","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:09.024782Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.13897/citation-record","integrity":"/paper/2506.13897/integrity","json":"/paper/2506.13897/citation-record.json","paper":"/paper/2506.13897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.839825Z","title":"Simultaneous real-time human fall detection and reidentification based on multisensors data","venue":null,"work_id":"d07b5b51-bc1e-4bb2-bf7f-0a1705efa8f3","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.745519Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:2a9e7eaee6ea54905732f0eba376174042d1a7ff46601021b6a443408e866b49","observation_id":"e40b5885-8f90-4c8e-ae2e-04ffd770125f","resolution":{"observed_at":"2026-08-07T00:31:16.917355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.676249Z","title":"A cross- dataset study for text-based 3d human motion retrieval","venue":null,"work_id":"9deabb2b-22a0-4b00-98f8-cb8ac9b9a169","year":1932},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.749961Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:fc7f32ab120dc58be9081bf5f8d424d2ac92668b873b298de875e57e2f27e616","observation_id":"cb1b9546-9b5f-42f2-bd44-c7ea1a761fcd","resolution":{"observed_at":"2026-08-07T00:31:16.726798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.753498Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.753498Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:cbec8cdcef95b0452ff5387b759f2ac419dcf36e7b20d281e9bc3ab660c66ac3","observation_id":"ccb862aa-7aeb-407c-8312-f5261f48da61","resolution":{"observed_at":"2026-08-07T00:31:08.753498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.493926Z","title":"Vitag: Online wifi fine time measurements aided vision-motion identity association in multi-person environ- ments","venue":null,"work_id":"17edaf0e-c3cf-4d34-b638-47b2cd0c49e3","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.757425Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d34ccba82eecfb4cbccf8d7a1a2c99fbaf4ad314d0ed0b61bb288e1430c4dad0","observation_id":"7857f5a2-0ed6-49e6-b3ad-390dea2ad75e","resolution":{"observed_at":"2026-08-07T00:31:16.578801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.761542Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.761542Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b3a8dcf04c01fd4feed00252730f04c0d32f44e5292dd9f21184de6efd1dc206","observation_id":"f6d5f471-2dbc-4cff-86c0-a9342e308acf","resolution":{"observed_at":"2026-08-07T00:31:08.761542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.765338Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.765338Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:4f37d51038cdebe4885ebc797d2dd076a8974ada388f879b349e29933402c31f","observation_id":"317164f3-ea84-4cd7-a9fc-3c9c16bff0c7","resolution":{"observed_at":"2026-08-07T00:31:08.765338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09444","last_updated":"2025-06-04T14:03:14Z","snapshot_observed_at":"2026-07-06T19:15:25.798160Z","submitted_at":"2024-09-14T14:11:45Z","title":"KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition","version":2},"cited_work":{"arxiv_id":"2409.09444","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09444","snapshot_observed_at":"2026-08-07T00:31:09.197145Z","title":"KAN-HyperpointNet for Point Cloud Sequence-Based 3D Human Action Recognition","venue":"cs.CV","work_id":"e7617033-24ec-4d1d-bde7-f208ac080d47","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.770398Z"},"links":{"cited_paper":"/paper/2409.09444","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:e17b8d491f6d4ea7b133f1ff33d3331a06e35eddd9c46691cdb037cf3bb01535","observation_id":"9893f43e-4aec-4b0d-bf65-849823a9fdde","resolution":{"observed_at":"2026-08-07T00:31:09.232273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17777","last_updated":"2025-03-21T10:51:22Z","snapshot_observed_at":"2026-08-03T04:15:44.371388Z","submitted_at":"2024-07-25T05:10:48Z","title":"Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17777","snapshot_observed_at":"2026-08-07T00:31:08.775111Z","title":"Advancing multi-modal sens- ing through expandable modality alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.775111Z"},"links":{"cited_paper":"/paper/2407.17777","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:00217a72717a58249c29c0dde0fb6a88e22c748cf375f1122e05a5f2f59c2a51","observation_id":"b994d7e2-0285-4f50-b2c9-e18055e6677a","resolution":{"observed_at":"2026-08-07T00:31:08.775111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.779587Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.779587Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:f16bc5d17d7e50c89552db7dddf60af89677393912325f2df5923f88ab60073b","observation_id":"4e14b556-94af-4947-94f4-6c9613900153","resolution":{"observed_at":"2026-08-07T00:31:08.779587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.300121Z","title":"Point 4d trans- former networks for spatio-temporal modeling in point cloud videos","venue":null,"work_id":"e0360fc1-121a-4efa-8bfa-351bde43db99","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.783290Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:0a6eb28ed937dcfc29734e729140ae036a342ea914cb41ef76f09e14772a0f0d","observation_id":"11d1f515-adef-44ea-a6f8-1d7ebb777918","resolution":{"observed_at":"2026-08-07T00:31:16.384357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:16.158997Z","title":"Pstnet: Point spatio-temporal convolution on point cloud sequences","venue":null,"work_id":"d9536183-bb23-4402-9928-9fbaf7712b63","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.787631Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:88e123d566840ba87263bf9177790f1035dc47ebeb6489c9624b29df1525ba2c","observation_id":"3639fdab-a366-4a27-9302-589313b63c21","resolution":{"observed_at":"2026-08-07T00:31:16.209325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.976824Z","title":"Deep hierarchical representation of point cloud videos via spatio-temporal decomposition","venue":null,"work_id":"ccabad07-967a-45d0-a295-94c7005347df","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.791793Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d6de1543b79b6f0c9b43da8b013fd4fc1f68b7f050721d2cc1a717d6dac3c47c","observation_id":"ea2838ba-706d-49d6-8b41-eff9ea2f5c48","resolution":{"observed_at":"2026-08-07T00:31:16.065265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.761398Z","title":"Point spatio- temporal transformer networks for point cloud video mod- eling","venue":null,"work_id":"15bf3e6c-2f22-4a59-a86a-c1cc3648c050","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.795650Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:261d7ee705bf2d2fad2ab9971cc6db0312b8a3a462a7f9f9d917d6f4ca22b84c","observation_id":"c0e91862-063d-4389-9d14-7da0f486430c","resolution":{"observed_at":"2026-08-07T00:31:15.889533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.621440Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"862cc05e-247c-40ab-b0e7-eb3a06faa553","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.799223Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:709386be366447b83efa0a85778ba90a92fbdb80f7e9a5ec891bf3c2205ce1e6","observation_id":"f7d346b0-3960-4b4c-a8b6-2bfbd4649711","resolution":{"observed_at":"2026-08-07T00:31:15.702694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.465972Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"9a0a8218-07d9-4e59-9c63-5bb6318ac177","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.802994Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:999145771cd99d8413aec9c158dfe86bed6f65002c8b753c1b14b7512ec8f790","observation_id":"98e1ccaa-1ae5-4b61-9c71-ba9ca51b8cf8","resolution":{"observed_at":"2026-08-07T00:31:15.538115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.360081Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"dadb28ea-523d-4588-aa1f-cbd97ea2e1d2","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.806915Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:221dc146df166943a5a9f3994bc370ee4fccdbedd7bb2e5a4d5331399bbf2d5e","observation_id":"471f20fc-b2c4-45fd-bae3-351aa9ef2da0","resolution":{"observed_at":"2026-08-07T00:31:15.409615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.223473Z","title":"Separating the” chirp” from the” chat”: Self-supervised visual grounding of sound and language","venue":null,"work_id":"df6764ee-0ec9-4033-93f2-21c27ba927d0","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.810412Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:daa9ced7cef901855b8c1630e52dc36964edc2a9be2d9f4929b3414699f563dd","observation_id":"176ec9fb-7a16-489e-92d8-6114e597e6e8","resolution":{"observed_at":"2026-08-07T00:31:15.274867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:15.068774Z","title":"Masked motion prediction with semantic contrast for point cloud sequence learning","venue":null,"work_id":"7e8fe5d2-707f-4319-acc2-0f95afff55fb","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.816042Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:441875a498706f239fe93bf7c0c95ea88a967de93778cdfa686428941de78333","observation_id":"972b00cd-e693-4015-8170-6330b22c24aa","resolution":{"observed_at":"2026-08-07T00:31:15.146605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.912475Z","title":"Long short-term memory","venue":null,"work_id":"9d0e994c-1486-41ca-a3d4-290222707870","year":1997},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.819626Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b989c033a0334c9eba1252a0468dae863d1290adf9c2ec244f10970ca578c66c","observation_id":"25764052-192c-4c02-9668-ba8ddf8acdf6","resolution":{"observed_at":"2026-08-07T00:31:14.988206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.759280Z","title":"Wifi and vision-integrated fingerprint for smartphone-based self-localization in public indoor scenes","venue":null,"work_id":"dfd0751a-9001-48b0-b6e8-fbfb1e4ccd62","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.823235Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:975f2b73b1cc7b3284980cf1645d444d4a9bd8aec6254f0ad383170d6609cbaa","observation_id":"430c6257-3d1c-4f7a-947c-186503ae3914","resolution":{"observed_at":"2026-08-07T00:31:14.841811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.622701Z","title":"Deep iner- tial poser: Learning to reconstruct human pose from sparse inertial measurements in real time","venue":null,"work_id":"6706d21a-2eda-474c-bc57-a7955420d4e5","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.826710Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7fcf352de0dc180bf8fc6939223d5bf8017fb3a6c73d7d10be0facbddcaded51","observation_id":"d949d751-7c6d-4df1-b3f7-c820a2d32667","resolution":{"observed_at":"2026-08-07T00:31:14.682984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:31:08.831075Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.831075Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:44fe03dbeac7b581d77c8ac2ee57430676e73f39fb4883f768cd0b7e6ca68c18","observation_id":"3d5fcfc7-8abd-44f1-9e18-81514c18d16d","resolution":{"observed_at":"2026-08-07T00:31:08.831075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.523456Z","title":"Coopera- tive learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"cb11e830-6487-4c7b-8a26-79e343cf3c99","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.836753Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:de0350a579576c30292f87d70a2374e8a0aff9d1e49eb837015c08e75097dd33","observation_id":"25ed570d-eb36-4629-86e5-eab2672e0a65","resolution":{"observed_at":"2026-08-07T00:31:14.573457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.403858Z","title":"Li- darcap: Long-range marker-less 3d human motion capture with lidar point clouds","venue":null,"work_id":"dc363a56-da97-412f-8184-471fa13680cf","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.840736Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7f0da32e614eb0c5cf8e69232589b5b472331554b90cf1bff8daebcc3093702b","observation_id":"7e2d25af-f34c-4a89-a12f-c1e661940c4b","resolution":{"observed_at":"2026-08-07T00:31:14.469948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04676","last_updated":"2022-02-08T16:36:12Z","snapshot_observed_at":"2026-08-04T03:00:58.368363Z","submitted_at":"2022-01-12T20:02:32Z","title":"UniFormer: Unified Transformer for Efficient Spatiotemporal Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04676","snapshot_observed_at":"2026-08-07T00:31:08.844410Z","title":"Uniformer: Unified transformer for efficient spatiotemporal representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.844410Z"},"links":{"cited_paper":"/paper/2201.04676","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8ef30b0a3dc5167d82cb9e18ec746ca020cdae40d2206a2e20fe333ba27fb948","observation_id":"4fe86579-9172-4095-bf33-09a8c94ee86e","resolution":{"observed_at":"2026-08-07T00:31:08.844410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.274163Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++","venue":null,"work_id":"3b76bd56-dc49-4753-9de2-4e07bcf8a8e1","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.848814Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d7f53dfcbb2d4d30a906811c9285aa2809eb062ee654ac4559bdb45809d48e38","observation_id":"54d393a1-e991-40cc-ab2e-8a80705c9c40","resolution":{"observed_at":"2026-08-07T00:31:14.330184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.200030Z","title":"Action recognition based on a bag of 3d points","venue":null,"work_id":"81d56a78-59eb-426a-accd-0e349a3bba57","year":2010},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.852450Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8079145b552168f0f922a8ae8f6aa1fd20cad8bd63e960690aaeee3979484c31","observation_id":"388fb97f-ebb6-4315-825f-6ad44bcb4b56","resolution":{"observed_at":"2026-08-07T00:31:14.230699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:14.073804Z","title":"En- hancing person identification for smart cities: Fusion of video surveillance and wearable device data based on ma- chine learning","venue":null,"work_id":"7676ac39-cb94-4767-891c-38d5f99c2d8e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.856458Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:bfdaf37ce04e2c9860d3b05a4f9ee51bf4d9469bd420ef0eafdf26c208123975","observation_id":"bdac9ea9-e02b-4498-bd4a-31645b9e196c","resolution":{"observed_at":"2026-08-07T00:31:14.127651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.971944Z","title":"Hm- pear: A dataset for human pose estimation and action recog- nition","venue":null,"work_id":"405bccf6-4b5b-4c80-bfd6-c625a2028320","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.860337Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:cf6f45f45309311d89d34141194f5f503605eac021032bcfccffe6221563a55d","observation_id":"3bf09b9f-2b26-4fd8-8f42-fc999411e5ac","resolution":{"observed_at":"2026-08-07T00:31:14.035557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.881253Z","title":"Ntu rgb+d 120: A large- scale benchmark for 3d human activity understanding","venue":null,"work_id":"17cd882b-787e-4fa0-984b-aecbd922d944","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.864134Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:22594affe3b61ce1a92962dbacd33c1b5787957e3479b8a02247ee22bdc38f30","observation_id":"b1e4050d-2620-46ab-9ac8-77005921729c","resolution":{"observed_at":"2026-08-07T00:31:13.906173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14338","last_updated":"2025-02-27T02:34:16Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:08:09Z","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","version":3},"cited_work":{"arxiv_id":"2405.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14338","snapshot_observed_at":"2026-08-07T00:31:09.118254Z","title":"MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models","venue":"cs.CV","work_id":"5f449edb-f970-42fb-a863-1a3fcd0d942e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.867539Z"},"links":{"cited_paper":"/paper/2405.14338","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:f71dfc9ded96c8044b35298fced6b0233fdc6a6ad6148ad5586de0c9ee2ae5b9","observation_id":"91aeb408-0e6d-46e5-ae50-4e735c24bf48","resolution":{"observed_at":"2026-08-07T00:31:09.135085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.750378Z","title":"Meteor- net: Deep learning on dynamic 3d point cloud sequences","venue":null,"work_id":"19a12437-cfbc-42f6-afd8-d4bf4592014f","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.872585Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8070dfb50f1bd76b5eabc4707a0d73cf95f811ffabaa6f460f05ac431c7394a6","observation_id":"f4da2ec3-786e-4f47-8f54-f81a0472209b","resolution":{"observed_at":"2026-08-07T00:31:13.815197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.628433Z","title":"Leaf: Learning frames for 4d point cloud sequence un- derstanding","venue":null,"work_id":"50650741-28e7-4af4-ba4f-c1c15855a58d","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.876508Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:15ac57d4fd7a1453f7ee169786efc71a616ca4f8391389e9caa74c5c87947c96","observation_id":"16919bed-1ad0-4da7-bdcb-1e94e247394d","resolution":{"observed_at":"2026-08-07T00:31:13.691254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.880755Z","title":"Smpl: A skinned multi- person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.880755Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:ed34a2b770b7a27ab35c6a2e981e5fca48a29020ea1f4be44ef4cc63506dcecd","observation_id":"f413bed6-0d9d-4763-b1d1-a7b08319a49c","resolution":{"observed_at":"2026-08-07T00:31:08.880755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.478905Z","title":"Cross- modal contrastive pre-training for few-shot skeleton action recognition","venue":null,"work_id":"f5005bc7-1c1d-4f3f-b7a6-5b830badf29e","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.885251Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:98f1b56cec99fa6f7c81a4bcf661af641fd7ce3a22922cc8ae9a9719fc53bfae","observation_id":"c21cf3f7-0599-4ebe-8f74-984d17d7fc68","resolution":{"observed_at":"2026-08-07T00:31:13.560080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.368196Z","title":"Troje, Ger- ard Pons-Moll, and Michael J","venue":null,"work_id":"dfcf7504-a828-48f1-9a94-155d1c1fd7ff","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.889185Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d0cd91644d52f0e9ed3ebfac8fb212b11fd1b7ab219c4911c6c881c1942f807e","observation_id":"bb8e5ad6-9ac2-410e-8aef-c2bcb568aa2c","resolution":{"observed_at":"2026-08-07T00:31:13.410458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.234436Z","title":"Who goes there? exploiting silhouettes and wearable signals for subject identification in multi-person environments","venue":null,"work_id":"3bb4643b-e84b-4ea4-b237-6bb9535328e5","year":2019},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.893337Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:fd9f4a9e08c32559b5ce32dbae17c8c10f18df251fb0feb48e2e502575c5d645","observation_id":"8b8092cf-8acc-49ed-8632-1824152f945e","resolution":{"observed_at":"2026-08-07T00:31:13.304107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:13.023772Z","title":"Person re-id by fusion of video silhouettes and wearable signals for home monitoring appli- cations","venue":null,"work_id":"1dbc5b20-fa58-464a-adf0-8bd3443ce1df","year":2020},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.896816Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:ddbbb4a0f16dcd5ceb1a08a4ef90d5f0ac2514b47dbed9f5297772011b11f0d2","observation_id":"29f9ce24-39da-409c-97a1-73e9032fb30b","resolution":{"observed_at":"2026-08-07T00:31:13.110013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.874698Z","title":"Imu2clip: Language-grounded motion sensor translation with multi- modal contrastive learning","venue":null,"work_id":"a9368593-435b-41ba-a885-95f9ce9445a2","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.901052Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:59c5792ac64876aa1d7123de6e29ac7338651344e46db20add2b90fde220c293","observation_id":"855475b5-cd27-49f0-9b92-a31eebaa2e19","resolution":{"observed_at":"2026-08-07T00:31:12.931028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.729105Z","title":"Person tracking by fusing pos- ture data from uav video and wearable sensors.IEEE Sensors Journal, 22(24):24150–24160, 2022","venue":null,"work_id":"bc397cc1-6fe5-482c-92d8-3e7e396e2aab","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.905441Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:78d3319fde7b7ea867177b757e7e9625dd3a098e9398c05aa87161e9f18b86f1","observation_id":"182efc78-bb05-458e-8db7-3a73b936b476","resolution":{"observed_at":"2026-08-07T00:31:12.782062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:31:08.909243Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.909243Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:74908a27f6538262c8fc6eb7499f0e4d9c7c863408226cef17b42551fed72712","observation_id":"e3cd2888-a3cf-4882-9be9-7adad9f8d7e4","resolution":{"observed_at":"2026-08-07T00:31:08.909243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T00:31:08.913260Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.913260Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:1bdba33777e78017f2810cfa9a84aaf6e773318c110d71b92f8504b891de9780","observation_id":"b53cc4b3-b2b0-49bd-aed4-1f0ceb62e16e","resolution":{"observed_at":"2026-08-07T00:31:08.913260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.570676Z","title":"Action- conditioned 3d human motion synthesis with transformer vae","venue":null,"work_id":"d64eb18a-76a4-4066-a81c-54e8ec7eaa00","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.917169Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:93150d06ef2a1b2a677a25c93a18081dcfabcc68a0007020e91293bea10dacaa","observation_id":"9843b6ac-3117-4951-a806-26c5c1cbb022","resolution":{"observed_at":"2026-08-07T00:31:12.636838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.450080Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis","venue":null,"work_id":"eb4c47e3-30df-47d8-9997-2088646d906b","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.920728Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:19e0d2c6ca52dbaa643adcf2f0983f1c89061d81d2e89039346cb86da00c4f3c","observation_id":"802c7b84-a169-4247-9658-eda5b2b45bdd","resolution":{"observed_at":"2026-08-07T00:31:12.496680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.305372Z","title":"Punnakkal, Arjun Chandrasekaran, Nikos Athanasiou, Alejandra Quiros-Ramirez, and Michael J","venue":null,"work_id":"22980ea2-9fb1-4673-83aa-379aab08065d","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.924836Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:3172e02597aa99a3b9a25a4600ff4879e190cbdaf72abbfbffa50edb2a03ed6c","observation_id":"ce9d47ee-431b-47db-9214-643b9b00837a","resolution":{"observed_at":"2026-08-07T00:31:12.378433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:12.146171Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"1169dc1f-723a-4ab8-bb56-801be39e6d56","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.928710Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d8d7b540f6cae77768487c9d9f1e6990d0819471cd546275bcd4cc19c69bba1c","observation_id":"a41b6222-5da6-4c7d-b269-c6625e049938","resolution":{"observed_at":"2026-08-07T00:31:12.227504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T00:31:08.933258Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.933258Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:b8fc713c90333ab88c00ce5a58b822a5e0756c8e156348412ec902eecf46a5bd","observation_id":"8fa55423-ef43-42f1-9917-3d543fd23bae","resolution":{"observed_at":"2026-08-07T00:31:08.933258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.997325Z","title":"Lidar-aid inertial poser: Large-scale human motion capture by sparse inertial and lidar sensors","venue":null,"work_id":"204ae7aa-d32e-432b-9989-e9b7db1c1cd6","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.937089Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:10936e6f9ac63203a7004864df7b8b779896d483e2d26fa5e049ea1558e3da58","observation_id":"d287306d-e8d7-4160-97ca-6fb274da0f01","resolution":{"observed_at":"2026-08-07T00:31:12.055781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-07T00:31:08.940795Z","title":"An overview of gradient descent optimiza- tion algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.940795Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:af259d6c658a38f8daeec467278af16e2fb54f6a4218ee3a9753628e7f7f6e57","observation_id":"a3c33b8f-facc-4c9a-95b9-c42faf3019ed","resolution":{"observed_at":"2026-08-07T00:31:08.940795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.794207Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":"90c81e08-696c-4523-aac8-3b2b45594a36","year":2016},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.944830Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:d988cf313eddc36c8eb1757292086d62eb9ff206fc3a31f1f61e6e7539333fcb","observation_id":"bda392e8-e92d-46ce-bff4-fdc1b1b5729c","resolution":{"observed_at":"2026-08-07T00:31:11.902001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.613701Z","title":"Masked spatio-temporal structure prediction for self- supervised learning on point cloud videos","venue":null,"work_id":"f1775a6e-55f1-4e1e-8abb-0c3dcdfbf0bd","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.948192Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:274a48e0f55df5fd9cc9f553e19b875f5b612e56952431ba4f222d650848c3b9","observation_id":"e957ef1f-3b81-4cb7-9d4a-2087db73a841","resolution":{"observed_at":"2026-08-07T00:31:11.723285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.467492Z","title":"Pointcmp: Contrastive mask prediction for self-supervised learning on point cloud videos","venue":null,"work_id":"795d0795-b363-4603-a11b-258212ab9276","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.951850Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:57b004a4049c3828f87322b12095c95ac252794dccf897c1cc7c2af05dafc34d","observation_id":"a768ba02-9176-40da-a329-7b51aa24e330","resolution":{"observed_at":"2026-08-07T00:31:11.546078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.296536Z","title":"Point contrastive predic- tion with semantic clustering for self-supervised learning on point cloud videos","venue":null,"work_id":"ec11d1c1-4f71-463c-9797-eb35678654a0","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.955388Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:0fa77440bed2e6e8c7c19549b768a759e9d403ddfed2df608b985f4b64e0f674","observation_id":"aabc64b4-3e2f-4c10-8889-a0d1f198a6ce","resolution":{"observed_at":"2026-08-07T00:31:11.390322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:11.085919Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"0968a603-43c2-49b8-9503-27ae38c736bc","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.958995Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7cfe21da69bd42a8955c3eb312cc8a37652bab939f4d91d1af50d37240cbc60f","observation_id":"a7dc5e15-7ce6-40fa-8bdb-470d57807ef2","resolution":{"observed_at":"2026-08-07T00:31:11.201864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.877236Z","title":"Total capture: 3d human pose estimation fusing video and inertial sensors","venue":null,"work_id":"5fb0e582-0221-4fdf-9a60-71995f7f40ed","year":2017},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.962562Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:c5f877a3a897f96cec38edf4e3c2ecbc092e08b379b450f9893c27924e3bcf91","observation_id":"8b5255a2-40d1-4526-9321-56307ca30e2b","resolution":{"observed_at":"2026-08-07T00:31:10.965041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:08.967112Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.967112Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:074db90939bdf6173b3621988aaf0287be2f6d3fbd6266bdce4063614db04aa1","observation_id":"ed5b9829-d6a4-45e4-b75a-6f11d877449a","resolution":{"observed_at":"2026-08-07T00:31:08.967112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.658675Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"2115347c-8ee2-4a4d-8b50-aec4661e421c","year":2018},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.971365Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:19cbff5b361bd05dece0347b29e0cbe2545b97b08cbd9d6c9f66b063f703a4c7","observation_id":"3ae3d5f4-37a7-423d-9517-1e5cab01630f","resolution":{"observed_at":"2026-08-07T00:31:10.755122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.483534Z","title":"Self-supervised 4d spatio-temporal feature learning via order prediction of sequential point cloud clips","venue":null,"work_id":"8019a9f3-eb7d-4d1e-b674-397222302176","year":2021},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.974914Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:31228c7ed39db1df474a6fd6f1928faaaa97d1003193c4f3988854d4f990d9b9","observation_id":"05c0eb15-50a9-46b2-a542-faadb188872d","resolution":{"observed_at":"2026-08-07T00:31:10.561759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.312181Z","title":"Pvnext: Rethinking network design and temporal motion for point cloud video recognition","venue":null,"work_id":"e60c0abf-b9f0-4332-b8c7-548b67d4a149","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.978422Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:9b43ce2e34f4b679bd48e5b084858167aec3a3b44bd8bf95a2baab2dbec54033","observation_id":"b35cdd34-dac4-4469-8af1-3b6a596fbf6b","resolution":{"observed_at":"2026-08-07T00:31:10.394401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:10.144448Z","title":"Point primitive transformer for long-term 4d point cloud video understanding","venue":null,"work_id":"62f10915-c260-4e5d-a9dc-8b136525bc85","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.982398Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:bc4c3d838872585a2071956dd28b87ee402e82aeeffc961c1e3b2e71bf708509","observation_id":"7ba69fe9-0809-4a95-adb7-44735acaef33","resolution":{"observed_at":"2026-08-07T00:31:10.222205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.950608Z","title":"Human-centric scene understanding for 3d large-scale scenarios","venue":null,"work_id":"37b8612c-0e9f-4fca-a39b-408970f288a5","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.986030Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7e3d315d5ec1077b0becdf717f14d64f4b2ef0096a6f209af6cce57eabc2e970","observation_id":"7a512346-9433-45ec-94d8-7aefa1e106eb","resolution":{"observed_at":"2026-08-07T00:31:10.028929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.751249Z","title":"Mm-fi: Multi-modal non-intrusive 4d human dataset for versatile wireless sensing","venue":null,"work_id":"bb5d21cf-8f86-4951-99a2-6954dbba723e","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.989682Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:ebc6f0c717f8f6e6e8db41d42089a94ae09896591c53b89337e7f4f7d572e05a","observation_id":"e0f74892-80a7-4148-9250-9907b255ed79","resolution":{"observed_at":"2026-08-07T00:31:09.866753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.623835Z","title":"Tri- modal motion retrieval by learning a joint embedding space","venue":null,"work_id":"57248059-02b8-4a82-97cc-81b59e64fd73","year":2024},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.993531Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:7a6560dc1d4af3d820b514ffc1bfd18062029feb1f1af5441588ed3455cead57","observation_id":"7dabb82c-ae7d-4ca4-a85a-3be905d6798f","resolution":{"observed_at":"2026-08-07T00:31:09.692831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.501897Z","title":"Complete-to-partial 4d distillation for self-supervised point cloud sequence representation learning","venue":null,"work_id":"d4ae8009-6aa2-4e27-8fc9-bcc2731701d8","year":2023},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:08.997412Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:17a586178cdf9ac9b67bf622f30b361ab48d292af238bb56c3b84c1e3805a44b","observation_id":"0b8af141-797f-4669-96ea-0936fe7809c4","resolution":{"observed_at":"2026-08-07T00:31:09.551420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.444398Z","title":"No pain, big gain: clas- sify dynamic point cloud sequences with static models by fitting feature-level space-time surfaces","venue":null,"work_id":"b9a63258-9a0a-49e8-ab25-1f0cc4a90376","year":2022},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.001121Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:a8f23df106630e0d84e1fac0095ab105a432bccfb0bfe96ed6facd2cf02861e7","observation_id":"4e4bc05d-e3ae-47e6-ba25-fcb4919286b6","resolution":{"observed_at":"2026-08-07T00:31:09.461845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.417869Z","title":"dataset/sequencecategory/posesequence poses.npz","venue":null,"work_id":"fcdd70ed-f077-4728-9d90-f5cfa8c988da","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.005187Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:cda04daa317ca08f6997064e33ac7cc9205302d1a0c5621a952fdc9082291302","observation_id":"3b1d518f-c12d-44d7-b421-df5e920c5981","resolution":{"observed_at":"2026-08-07T00:31:09.430191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.386217Z","title":null,"venue":null,"work_id":"6db44483-ab68-4f5f-845d-cf9db84e369a","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.016794Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:15833426c018cb3bc56392bfc5956551d97533795a4967368c62478b9618fa1a","observation_id":"becb311d-8192-47c7-a5bd-6d35bc762cb3","resolution":{"observed_at":"2026-08-07T00:31:09.402965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.342479Z","title":null,"venue":null,"work_id":"d59e5b7b-315b-4f6b-9523-0303c9379231","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.020566Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:c255cc4540935acf01f34331bfad28faee25b99bda233bae98c8e5811eedf7eb","observation_id":"060f64db-90a9-471b-809c-b2cc8c3e5a01","resolution":{"observed_at":"2026-08-07T00:31:09.367406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:09.271035Z","title":"We ablate linear/non-linear probing and freezing or fine-tuning each model when train- ing for HAR on LIPD-Babel-v2","venue":null,"work_id":"95c0d29a-1f07-4c5e-bf6b-3c0744bfd558","year":null},"citing_paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:09.024782Z"},"links":{"citing_paper":"/paper/2506.13897"},"observation_digest":"sha256:8ec6dddae1bd47c31c52701267b91ef30621409e47ddf9174efde819f43e2ceb","observation_id":"efb3a3ce-382e-4079-9186-b321acf8b553","resolution":{"observed_at":"2026-08-07T00:31:09.291940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13897","last_updated":"2025-06-25T19:20:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T02:36:18.594974Z","submitted_at":"2025-06-16T18:18:44Z","title":"DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":52},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2506.13897."}